Le mystérieux grand modèle « Ox Alpha » fait le buzz, gratuit pour un temps limité

marsbitPublié le 2026-08-23Dernière mise à jour le 2026-08-23

Résumé

Le monde des grands modèles de langage (LLM) est en effervescence avec l'apparition d'Ox Alpha, un modèle anonyme surnommé « Niu Lai » par les internautes chinois. Proposé gratuitement et temporairement sur OpenRouter, il dispose d'un contexte de 1 million de tokens et prend en charge texte, images et vidéos. Son évaluation sur des tâches d'ingénierie logicielle réelles (benchmark DeepSWE) montre des performances impressionnantes, avec un taux de réussite initial de 80% sur un sous-ensemble de tests, rivalisant ainsi avec les meilleurs modèles de codage actuels. Bien que d'autres tests aient rapporté un score d'environ 63%, son fort potentiel est établi. Son origine fait l'objet de vives spéculations. Plusieurs indices techniques pointent vers une version non publiée de GLM-5.3 (probablement GLM-5.3 Flash ou sa variante multimodale) développée par Zhipu AI : alignement parfait du comptage de tokens visuels et textuels avec GLM-5V-Turbo/GLM-5.3, comportements de refus et style de réponse similaires. L'entreprise n'a cependant pas confirmé. Parallèlement, un autre modèle anonyme nommé « korrine » apparaît sur Code Arena, suscitant des hypothèses le liant à Kimi, Qwen ou MiMo. Cette tendance au test anonyme (« sous couverture ») permet aux développeurs d'évaluer objectivement les capacités des modèles, sans biais de marque, et de les soumettre à des tests de stress en conditions réelles avant un lancement officiel, tout en générant du buzz marketing. La performance d'Ox Alph...

Les tests « sous couverture » sont populaires dans le cercle des grands modèles.

Récemment, un modèle anonyme nommé Ox Alpha est soudainement apparu sur OpenRouter. Ox signifiant lui-même « bœuf », les internautes chinois lui ont rapidement donné un nom plus évocateur :

Le grand modèle « Niu Lai » (牛来, « le bœuf arrive »).

Selon les informations divulguées par OpenRouter, Ox Alpha dispose d'un contexte de 1 million de tokens, prend en charge l'entrée de texte, d'images et de vidéos, peut appeler des outils et est actuellement entièrement gratuit.

Peu après son lancement, les développeurs l'ont connecté à un Agent de codage et l'ont jeté dans un véritable dépôt de code pour le tester.

Les résultats des tests préliminaires montrent que ce grand modèle « Niu Lai » d'origine inconnue a des capacités qui se rapprochent déjà des meilleurs modèles de code actuels.

Dans le même temps, des internautes ont révélé qu'un modèle anonyme nommé korrine était en cours de test sur Code Arena. Certains ont deviné qu'il s'agissait de Kimi K3.1, d'autres l'ont attribué à Qwen ou MiMo, les hypothèses vont dans tous les sens.

Le cercle des grands modèles en août s'est soudain transformé en un grand jeu de devinettes.

Des performances remarquables pour le modèle « Niu Lai »

Ce qui a vraiment attiré l'attention sur Ox Alpha, c'est sa capacité en codage.

Le développeur Ben Davis a extrait 10 tâches de DeepSWE pour les tester. Ox Alpha en a accompli 8, soit un taux de réussite de 80%. Dans les résultats comparatifs qu'il a publiés, Fable 5 Max atteint 65%, GLM-5.3 Max et Grok 4.6 xhigh atteignent tous deux 62%, et GPT-5.6 Sol Max atteint 52%.

DeepSWE évalue les véritables capacités en génie logiciel. Le modèle doit lire un dépôt de code, localiser un problème, modifier le code, exécuter des tests, puis procéder à d'autres corrections en fonction des erreurs signalées. Comparé à un problème de programmation en un seul tour, cela se rapproche davantage du travail réel d'un Agent de codage.

Cependant, l'échantillon de 10 tâches est très petit. Par la suite, d'autres développeurs ont testé sur un autre sous-ensemble de DeepSWE, obtenant un résultat d'environ 63%. La portée des tâches et la configuration d'exécution des deux tests n'étant pas exactement les mêmes, il est impossible pour l'instant d'en déduire le classement précis d'Ox Alpha.

Cependant, ces résultats montrent de manière préliminaire que ce modèle anonyme a déjà démontré un fort potentiel en codage de long contexte, avec des capacités se rapprochant des modèles leaders actuels.

À qui appartient vraiment le modèle « Niu Lai » ?

L'identité du modèle « Niu Lai » est actuellement attribuée, selon la rumeur la plus répandue, soit à GLM-5.3 Flash de Zhipu AI qui n'a pas encore été publié, soit à une version multimodale de GLM-5.3.

Quelqu'un a même écrit un blog pour l'analyser :

1. La preuve la plus forte vient de l'encodeur vidéo. Sur quatre vidéos de différentes fréquences d'images, durées et résolutions, le nombre de tokens visuels consommés par Ox Alpha est exactement le même que celui de GLM-5V-Turbo. MiMo, Qwen et GLM-4.6V présentent tous des résultats nettement différents.

2. Le tokenizer de texte correspond également étroitement. Le chercheur a testé 25 ensembles d'invites ; le nombre de tokens d'Ox Alpha et de GLM-5.3 maintient toujours un écart fixe de 75 tokens.

3. D'autres caractéristiques pointent également vers Zhipu AI. Ox Alpha refuse de traiter l'audio, de la même manière que GLM-5V ; le style de réponse, le nombre d'étapes d'exécution de l'Agent et l'interface d'inférence sont également proches de GLM. Zhipu AI avait déjà précédemment testé GLM-5 anonymement sous le nom de Pony Alpha, établissant un précédent pour ce type d'opération.

https://ox-alpha-evidence-production.up.railway.app/

D'autres internautes ont trouvé des indices dans les conversations.

Ben Davis estime à 99% qu'il s'agit de GLM-5.x.

Ces indices renforcent la crédibilité de la thèse GLM, mais ne suffisent pas encore à confirmer l'identité.

À ce jour, ni OpenRouter ni Zhipu AI n'ont répondu publiquement.

L'identité de korrine est encore plus énigmatique

Alors que l'identité du modèle « Niu Lai » reste floue, un autre modèle anonyme nommé korrine est apparu sur Code Arena.

Initialement, beaucoup ont supposé qu'il s'agissait de Kimi K3.1, car avant la sortie de Kimi K3, on pensait qu'il avait été testé sous le nom de code kivine. La structure similaire entre kivine et korrine a suscité cette association.

Cependant, la personne ayant initialement diffusé l'information a ensuite ajouté que le nouveau modèle de Moonshot dont elle avait eu connaissance pourrait correspondre à un autre nom de code, adamant-ananke. Korrine pourrait également provenir d'autres équipes chinoises comme Qwen.

Dans les commentaires, certains l'ont également attribué à MiMo V3.

Pourquoi les éditeurs de grands modèles aiment-ils « se cacher » ?

Les tests anonymes deviennent un élément important avant la publication officielle d'un grand modèle.

Masquer l'éditeur et le modèle dans l'Arena permet d'atténuer autant que possible les préjugés liés à la marque. Les utilisateurs ne voyant pas l'identité du modèle ne peuvent choisir qu'en fonction des sorties réelles, et les résultats des matchs accumulés se rapprochent ainsi davantage de l'expérience utilisateur réelle.

OpenRouter offre un autre type d'environnement de test.

Les développeurs connectent le modèle à divers Agents de codage, le font entrer dans des dépôts réels, appeler continuellement des outils, et traiter des tâches de génie logiciel pouvant durer plusieurs heures. La stabilité du contexte, la fiabilité des appels d'outils, la possibilité que le modèle tourne en rond ou dévie pendant des tâches longues, tout cela peut être rapidement exposé lors d'une utilisation intensive.

Pour les éditeurs de modèles, cela équivaut à un test de résistance public. Les équipes peuvent observer à l'avance les cas d'échec, vérifier la capacité de charge du service d'inférence, et également accumuler une réputation réelle avant la publication officielle.

De plus, « deviner le modèle » devient de plus en plus un outil de marketing ; le suspense sur l'identité peut effectivement prolonger le cycle des discussions.

Pour en revenir au modèle lui-même. Si Ox Alpha est vraiment un modèle Flash dont les capacités en codage se rapprochent déjà du niveau des leaders, où pourrait nous mener la version complète, avec plus de ressources et des capacités plus abouties ?

Liens de référence :

https://x.com/Adidotdev/status/2090833298713096241

https://x.com/davis7/status/2090669483740279155?s=20

https://x.com/davis7/status/2090655207831298095?s=20

https://x.com/MaxForAI/status/2090783750217162788

Cet article provient du compte officiel WeChat « Machine Heart » (ID : almosthuman2014), auteur : Suivre l'IA.

Questions liées

QQu'est-ce que l'Ox Alpha, et pourquoi est-il surnommé '牛来' en ligne ?

AOx Alpha est un modèle de langage anonyme récemment apparu sur OpenRouter. Comme 'Ox' signifie 'bœuf', les internautes chinois lui ont donné le surnom humoristique de '牛来', ce qui peut se traduire par 'Le Bœuf Arrive' ou 'Voilà le Bœuf'.

QQuelle est la capacité de traitement de contexte d'Ox Alpha et quels types d'entrées prend-il en charge ?

ASelon les informations d'OpenRouter, Ox Alpha possède un contexte de 1 million de tokens et prend en charge les entrées de texte, d'image et de vidéo. Il peut également appeler des outils et est actuellement entièrement gratuit.

QQuels sont les arguments principaux avancés pour suggérer qu'Ox Alpha pourrait être un modèle de Zhipu (GLM) ?

APlusieurs indices pointent vers Zhipu AI : 1) La consommation de tokens visuels pour la vidéo est identique à celle du GLM-5V-Turbo. 2) Le nombre de tokens textuels présente un écart constant avec le GLM-5.3. 3) Le modèle refuse de traiter l'audio, comme le fait GLM-5V. 4) Son style de réponse et son interface de raisonnement sont similaires. 5) Zhipu a déjà testé anonymement des modèles comme Pony Alpha par le passé.

QQuel autre modèle anonyme est testé sur Code Arena en parallèle, et quelles sont les spéculations sur son origine ?

AUn autre modèle anonyme nommé 'korrine' est testé sur Code Arena. Les spéculations incluent qu'il pourrait s'agir de la version K3.1 de Kimi (Moonshot AI), d'un nouveau modèle de Qwen ou de la version V3 de MiMo. Son origine reste très incertaine.

QPourquoi les développeurs de grands modèles de langage procèdent-ils à des tests anonymes ('sous couverture') ?

ALes tests anonymes servent plusieurs objectifs : 1) Éliminer les préjugés liés à la marque pour obtenir des évaluations plus objectives. 2) Effectuer des tests de stress en conditions réelles, par exemple dans des agents de codage, pour révéler les problèmes sur de longues tâches. 3) Accumuler des retours et une réputation avant la sortie officielle. 4) Cela peut aussi être une stratégie marketing, créant du suspense et prolongant les discussions.

Lectures associées

Rétrospective sur le piratage de Coldcard : Le code source visible n'est pas synonyme de sécurité

L'affaire du vol de portefeuilles matériels Coldcard, entraînant la perte de plus de 150 millions de dollars en Bitcoin, a relancé le débat sur la sécurité du code open source. L'article souligne que la simple disponibilité du code source ("source available") ne garantit pas sa sécurité. Une distinction cruciale est faite entre les logiciels libres/open source (FOSS/FLOSS), qui offrent les quatre libertés fondamentales, et le code simplement lisible, qui peut restreindre l'usage commercial et donc les incitations à un audit approfondi. Le cas Coldcard illustre ce problème : son firmware, sous licence MIT avec restrictions, n'a pas bénéficié d'un examen significatif de la communauté pendant des années, laissant passer une faille critique. Cela démontre que la sécurité dans l'open source repose non sur la transparence passive, mais sur l'existence d'incitations économiques et de compétences pour réaliser des audits continus. Des projets comme Bitcoin Core montrent le modèle fonctionnel, avec un développement et une révision collégiale entièrement publics. L'article analyse aussi l'économie de l'open source : la plupart des utilisateurs s'appuient sur l'hypothèse que "quelqu'un d'autre vérifie", ce qui peut mener à une tragédie des biens communs si les incitations sont mal alignées. Enfin, l'émergence de l'IA modifie la donne. D'un côté, des outils comme le Bitcoin Red Team prouvent que l'IA peut accélérer massivement la détection de vulnérabilités. De l'autre, le flux de code généré par l'IA accable les mainteneurs de projets. Dans ce nouveau paysage, seuls les logiciels faisant l'objet d'audits rigoureux et continus, qu'ils soient open source ou privés, pourront résister à la pression accrue des attaques financières et technologiques.

marsbitIl y a 44 mins

Rétrospective sur le piratage de Coldcard : Le code source visible n'est pas synonyme de sécurité

marsbitIl y a 44 mins

Les ETF spot sur le Bitcoin et l'Ethereum attirent 2,6 milliards de dollars en une semaine : un record depuis octobre 2025

Les ETF spot américains sur Bitcoin et Ethereum ont attiré 2,6 milliards de dollars d'afflux net de capitaux en une semaine, un record depuis octobre 2025. Les ETF Bitcoin ont reçu 1,9 milliard de dollars, tandis que les fonds Ethereum ont attiré 697,2 millions de dollars, des chiffres records pour l'année 2026. Ce résultat marque un renversement notable par rapport à la semaine précédente, qui avait enregistré un retrait de 392 millions de dollars. L'activité de trading des ETF Bitcoin a plus que triplé, atteignant 22,1 milliards de dollars, et leurs actifs sous gestion ont augmenté de 25,4% pour atteindre 96,1 milliards de dollars. Les achats se sont concentrés les 19 et 20 août, avec le fonds IBIT de BlackRock captant à lui seul 503 millions de dollars sur 606,3 millions d'afflux en une journée. Les ETF sur Ethereum ont également connu leur meilleure semaine depuis octobre 2025, avec un volume de trading en hausse de 259,4% à 6,9 milliards de dollars et des actifs sous gestion en progression de 35,9% à 14,3 milliards de dollars. Cependant, malgré cette semaine exceptionnelle, les catégories Bitcoin et Ethereum affichent toujours des retraits nets depuis le début de l'année 2026, respectivement de 2,9 milliards et 191,8 millions de dollars. L'analyse souligne que la forte concentration des flux vers un seul fonds, comme l'IBIT, peut constituer à la fois un signe de confiance et une vulnérabilité structurelle, capable d'inverser rapidement la tendance en cas de changement de sentiment.

cryptonews.ruIl y a 56 mins

Les ETF spot sur le Bitcoin et l'Ethereum attirent 2,6 milliards de dollars en une semaine : un record depuis octobre 2025

cryptonews.ruIl y a 56 mins

Pourquoi le Trésor américain intensifie ses rachats de dette à long terme, et pourquoi l'or et le Bitcoin montent-ils ?

Le Trésor américain a annoncé un doublement du programme de rachat de ses obligations à long terme à partir du 9 septembre, une mesure visant à soutenir la liquidité du marché. Cette décision, intervenue dans un contexte de hausse continue des rendements obligataires et d'affaiblissement du dollar, a ravivé les craintes d'une dépréciation de la devise américaine, servant de catalyseur principal à une forte hausse du bitcoin et de l'or. Le bitcoin a connu une progression particulièrement marquée, avec des gains quotidiens d'environ 6% pendant trois séances consécutives. L'or a également bénéficié de la faiblesse du dollar, franchissant sa moyenne mobile sur 200 jours. Les analystes expliquent que l'annonce du Trésor a relancé le "trade de dépréciation monétaire", poussant les investisseurs vers des actifs considérés comme des valeurs refuges face à l'érosion anticipée du pouvoir d'achat du dollar. Cependant, le marché obligataire est resté sceptique, les rendements des obligations à 10 et 30 ans étant rapidement revenus à leurs niveaux d'avant l'annonce. Cette réaction met en doute l'efficacité réelle de l'opération pour soulager la pression sur les taux à long terme. Des facteurs supplémentaires, comme une réunion à la Maison Blanche sur la régulation des cryptomonnaies et des rachats forcés de positions vendeuses sur le bitcoin, ont aussi contribué à la hausse. En définitive, bien que l'intervention du Trésor ait provoqué un mouvement de fuite vers les actifs tangibles, elle ne semble pas avoir modifié les dynamiques fondamentales du marché obligataire, où persistent les inquiétudes concernant le déficit budgétaire, l'inflation et le fardeau de la dette publique américaine.

华尔街日报Il y a 4 h

Pourquoi le Trésor américain intensifie ses rachats de dette à long terme, et pourquoi l'or et le Bitcoin montent-ils ?

华尔街日报Il y a 4 h

Trading

Spot
活动图片