Les tests « sous couverture » sont populaires dans le cercle des grands modèles.
Récemment, un modèle anonyme nommé Ox Alpha est soudainement apparu sur OpenRouter. Ox signifiant lui-même « bœuf », les internautes chinois lui ont rapidement donné un nom plus évocateur :
Le grand modèle « Niu Lai » (牛来, « le bœuf arrive »).
Selon les informations divulguées par OpenRouter, Ox Alpha dispose d'un contexte de 1 million de tokens, prend en charge l'entrée de texte, d'images et de vidéos, peut appeler des outils et est actuellement entièrement gratuit.

Peu après son lancement, les développeurs l'ont connecté à un Agent de codage et l'ont jeté dans un véritable dépôt de code pour le tester.
Les résultats des tests préliminaires montrent que ce grand modèle « Niu Lai » d'origine inconnue a des capacités qui se rapprochent déjà des meilleurs modèles de code actuels.
Dans le même temps, des internautes ont révélé qu'un modèle anonyme nommé korrine était en cours de test sur Code Arena. Certains ont deviné qu'il s'agissait de Kimi K3.1, d'autres l'ont attribué à Qwen ou MiMo, les hypothèses vont dans tous les sens.
Le cercle des grands modèles en août s'est soudain transformé en un grand jeu de devinettes.
Des performances remarquables pour le modèle « Niu Lai »
Ce qui a vraiment attiré l'attention sur Ox Alpha, c'est sa capacité en codage.
Le développeur Ben Davis a extrait 10 tâches de DeepSWE pour les tester. Ox Alpha en a accompli 8, soit un taux de réussite de 80%. Dans les résultats comparatifs qu'il a publiés, Fable 5 Max atteint 65%, GLM-5.3 Max et Grok 4.6 xhigh atteignent tous deux 62%, et GPT-5.6 Sol Max atteint 52%.

DeepSWE évalue les véritables capacités en génie logiciel. Le modèle doit lire un dépôt de code, localiser un problème, modifier le code, exécuter des tests, puis procéder à d'autres corrections en fonction des erreurs signalées. Comparé à un problème de programmation en un seul tour, cela se rapproche davantage du travail réel d'un Agent de codage.
Cependant, l'échantillon de 10 tâches est très petit. Par la suite, d'autres développeurs ont testé sur un autre sous-ensemble de DeepSWE, obtenant un résultat d'environ 63%. La portée des tâches et la configuration d'exécution des deux tests n'étant pas exactement les mêmes, il est impossible pour l'instant d'en déduire le classement précis d'Ox Alpha.

Cependant, ces résultats montrent de manière préliminaire que ce modèle anonyme a déjà démontré un fort potentiel en codage de long contexte, avec des capacités se rapprochant des modèles leaders actuels.
À qui appartient vraiment le modèle « Niu Lai » ?
L'identité du modèle « Niu Lai » est actuellement attribuée, selon la rumeur la plus répandue, soit à GLM-5.3 Flash de Zhipu AI qui n'a pas encore été publié, soit à une version multimodale de GLM-5.3.
Quelqu'un a même écrit un blog pour l'analyser :
1. La preuve la plus forte vient de l'encodeur vidéo. Sur quatre vidéos de différentes fréquences d'images, durées et résolutions, le nombre de tokens visuels consommés par Ox Alpha est exactement le même que celui de GLM-5V-Turbo. MiMo, Qwen et GLM-4.6V présentent tous des résultats nettement différents.
2. Le tokenizer de texte correspond également étroitement. Le chercheur a testé 25 ensembles d'invites ; le nombre de tokens d'Ox Alpha et de GLM-5.3 maintient toujours un écart fixe de 75 tokens.
3. D'autres caractéristiques pointent également vers Zhipu AI. Ox Alpha refuse de traiter l'audio, de la même manière que GLM-5V ; le style de réponse, le nombre d'étapes d'exécution de l'Agent et l'interface d'inférence sont également proches de GLM. Zhipu AI avait déjà précédemment testé GLM-5 anonymement sous le nom de Pony Alpha, établissant un précédent pour ce type d'opération.

https://ox-alpha-evidence-production.up.railway.app/
D'autres internautes ont trouvé des indices dans les conversations.

Ben Davis estime à 99% qu'il s'agit de GLM-5.x.

Ces indices renforcent la crédibilité de la thèse GLM, mais ne suffisent pas encore à confirmer l'identité.
À ce jour, ni OpenRouter ni Zhipu AI n'ont répondu publiquement.
L'identité de korrine est encore plus énigmatique
Alors que l'identité du modèle « Niu Lai » reste floue, un autre modèle anonyme nommé korrine est apparu sur Code Arena.
Initialement, beaucoup ont supposé qu'il s'agissait de Kimi K3.1, car avant la sortie de Kimi K3, on pensait qu'il avait été testé sous le nom de code kivine. La structure similaire entre kivine et korrine a suscité cette association.

Cependant, la personne ayant initialement diffusé l'information a ensuite ajouté que le nouveau modèle de Moonshot dont elle avait eu connaissance pourrait correspondre à un autre nom de code, adamant-ananke. Korrine pourrait également provenir d'autres équipes chinoises comme Qwen.

Dans les commentaires, certains l'ont également attribué à MiMo V3.

Pourquoi les éditeurs de grands modèles aiment-ils « se cacher » ?
Les tests anonymes deviennent un élément important avant la publication officielle d'un grand modèle.
Masquer l'éditeur et le modèle dans l'Arena permet d'atténuer autant que possible les préjugés liés à la marque. Les utilisateurs ne voyant pas l'identité du modèle ne peuvent choisir qu'en fonction des sorties réelles, et les résultats des matchs accumulés se rapprochent ainsi davantage de l'expérience utilisateur réelle.
OpenRouter offre un autre type d'environnement de test.
Les développeurs connectent le modèle à divers Agents de codage, le font entrer dans des dépôts réels, appeler continuellement des outils, et traiter des tâches de génie logiciel pouvant durer plusieurs heures. La stabilité du contexte, la fiabilité des appels d'outils, la possibilité que le modèle tourne en rond ou dévie pendant des tâches longues, tout cela peut être rapidement exposé lors d'une utilisation intensive.
Pour les éditeurs de modèles, cela équivaut à un test de résistance public. Les équipes peuvent observer à l'avance les cas d'échec, vérifier la capacité de charge du service d'inférence, et également accumuler une réputation réelle avant la publication officielle.
De plus, « deviner le modèle » devient de plus en plus un outil de marketing ; le suspense sur l'identité peut effectivement prolonger le cycle des discussions.
Pour en revenir au modèle lui-même. Si Ox Alpha est vraiment un modèle Flash dont les capacités en codage se rapprochent déjà du niveau des leaders, où pourrait nous mener la version complète, avec plus de ressources et des capacités plus abouties ?
Liens de référence :
https://x.com/Adidotdev/status/2090833298713096241
https://x.com/davis7/status/2090669483740279155?s=20
https://x.com/davis7/status/2090655207831298095?s=20
https://x.com/MaxForAI/status/2090783750217162788
Cet article provient du compte officiel WeChat « Machine Heart » (ID : almosthuman2014), auteur : Suivre l'IA.





