Le mystérieux grand modèle « Ox Alpha » fait le buzz, gratuit pour un temps limité

marsbitPublié le 2026-08-23Dernière mise à jour le 2026-08-23

Résumé

Le monde des grands modèles de langage (LLM) est en effervescence avec l'apparition d'Ox Alpha, un modèle anonyme surnommé « Niu Lai » par les internautes chinois. Proposé gratuitement et temporairement sur OpenRouter, il dispose d'un contexte de 1 million de tokens et prend en charge texte, images et vidéos. Son évaluation sur des tâches d'ingénierie logicielle réelles (benchmark DeepSWE) montre des performances impressionnantes, avec un taux de réussite initial de 80% sur un sous-ensemble de tests, rivalisant ainsi avec les meilleurs modèles de codage actuels. Bien que d'autres tests aient rapporté un score d'environ 63%, son fort potentiel est établi. Son origine fait l'objet de vives spéculations. Plusieurs indices techniques pointent vers une version non publiée de GLM-5.3 (probablement GLM-5.3 Flash ou sa variante multimodale) développée par Zhipu AI : alignement parfait du comptage de tokens visuels et textuels avec GLM-5V-Turbo/GLM-5.3, comportements de refus et style de réponse similaires. L'entreprise n'a cependant pas confirmé. Parallèlement, un autre modèle anonyme nommé « korrine » apparaît sur Code Arena, suscitant des hypothèses le liant à Kimi, Qwen ou MiMo. Cette tendance au test anonyme (« sous couverture ») permet aux développeurs d'évaluer objectivement les capacités des modèles, sans biais de marque, et de les soumettre à des tests de stress en conditions réelles avant un lancement officiel, tout en générant du buzz marketing. La performance d'Ox Alph...

Les tests « sous couverture » sont populaires dans le cercle des grands modèles.

Récemment, un modèle anonyme nommé Ox Alpha est soudainement apparu sur OpenRouter. Ox signifiant lui-même « bœuf », les internautes chinois lui ont rapidement donné un nom plus évocateur :

Le grand modèle « Niu Lai » (牛来, « le bœuf arrive »).

Selon les informations divulguées par OpenRouter, Ox Alpha dispose d'un contexte de 1 million de tokens, prend en charge l'entrée de texte, d'images et de vidéos, peut appeler des outils et est actuellement entièrement gratuit.

Peu après son lancement, les développeurs l'ont connecté à un Agent de codage et l'ont jeté dans un véritable dépôt de code pour le tester.

Les résultats des tests préliminaires montrent que ce grand modèle « Niu Lai » d'origine inconnue a des capacités qui se rapprochent déjà des meilleurs modèles de code actuels.

Dans le même temps, des internautes ont révélé qu'un modèle anonyme nommé korrine était en cours de test sur Code Arena. Certains ont deviné qu'il s'agissait de Kimi K3.1, d'autres l'ont attribué à Qwen ou MiMo, les hypothèses vont dans tous les sens.

Le cercle des grands modèles en août s'est soudain transformé en un grand jeu de devinettes.

Des performances remarquables pour le modèle « Niu Lai »

Ce qui a vraiment attiré l'attention sur Ox Alpha, c'est sa capacité en codage.

Le développeur Ben Davis a extrait 10 tâches de DeepSWE pour les tester. Ox Alpha en a accompli 8, soit un taux de réussite de 80%. Dans les résultats comparatifs qu'il a publiés, Fable 5 Max atteint 65%, GLM-5.3 Max et Grok 4.6 xhigh atteignent tous deux 62%, et GPT-5.6 Sol Max atteint 52%.

DeepSWE évalue les véritables capacités en génie logiciel. Le modèle doit lire un dépôt de code, localiser un problème, modifier le code, exécuter des tests, puis procéder à d'autres corrections en fonction des erreurs signalées. Comparé à un problème de programmation en un seul tour, cela se rapproche davantage du travail réel d'un Agent de codage.

Cependant, l'échantillon de 10 tâches est très petit. Par la suite, d'autres développeurs ont testé sur un autre sous-ensemble de DeepSWE, obtenant un résultat d'environ 63%. La portée des tâches et la configuration d'exécution des deux tests n'étant pas exactement les mêmes, il est impossible pour l'instant d'en déduire le classement précis d'Ox Alpha.

Cependant, ces résultats montrent de manière préliminaire que ce modèle anonyme a déjà démontré un fort potentiel en codage de long contexte, avec des capacités se rapprochant des modèles leaders actuels.

À qui appartient vraiment le modèle « Niu Lai » ?

L'identité du modèle « Niu Lai » est actuellement attribuée, selon la rumeur la plus répandue, soit à GLM-5.3 Flash de Zhipu AI qui n'a pas encore été publié, soit à une version multimodale de GLM-5.3.

Quelqu'un a même écrit un blog pour l'analyser :

1. La preuve la plus forte vient de l'encodeur vidéo. Sur quatre vidéos de différentes fréquences d'images, durées et résolutions, le nombre de tokens visuels consommés par Ox Alpha est exactement le même que celui de GLM-5V-Turbo. MiMo, Qwen et GLM-4.6V présentent tous des résultats nettement différents.

2. Le tokenizer de texte correspond également étroitement. Le chercheur a testé 25 ensembles d'invites ; le nombre de tokens d'Ox Alpha et de GLM-5.3 maintient toujours un écart fixe de 75 tokens.

3. D'autres caractéristiques pointent également vers Zhipu AI. Ox Alpha refuse de traiter l'audio, de la même manière que GLM-5V ; le style de réponse, le nombre d'étapes d'exécution de l'Agent et l'interface d'inférence sont également proches de GLM. Zhipu AI avait déjà précédemment testé GLM-5 anonymement sous le nom de Pony Alpha, établissant un précédent pour ce type d'opération.

https://ox-alpha-evidence-production.up.railway.app/

D'autres internautes ont trouvé des indices dans les conversations.

Ben Davis estime à 99% qu'il s'agit de GLM-5.x.

Ces indices renforcent la crédibilité de la thèse GLM, mais ne suffisent pas encore à confirmer l'identité.

À ce jour, ni OpenRouter ni Zhipu AI n'ont répondu publiquement.

L'identité de korrine est encore plus énigmatique

Alors que l'identité du modèle « Niu Lai » reste floue, un autre modèle anonyme nommé korrine est apparu sur Code Arena.

Initialement, beaucoup ont supposé qu'il s'agissait de Kimi K3.1, car avant la sortie de Kimi K3, on pensait qu'il avait été testé sous le nom de code kivine. La structure similaire entre kivine et korrine a suscité cette association.

Cependant, la personne ayant initialement diffusé l'information a ensuite ajouté que le nouveau modèle de Moonshot dont elle avait eu connaissance pourrait correspondre à un autre nom de code, adamant-ananke. Korrine pourrait également provenir d'autres équipes chinoises comme Qwen.

Dans les commentaires, certains l'ont également attribué à MiMo V3.

Pourquoi les éditeurs de grands modèles aiment-ils « se cacher » ?

Les tests anonymes deviennent un élément important avant la publication officielle d'un grand modèle.

Masquer l'éditeur et le modèle dans l'Arena permet d'atténuer autant que possible les préjugés liés à la marque. Les utilisateurs ne voyant pas l'identité du modèle ne peuvent choisir qu'en fonction des sorties réelles, et les résultats des matchs accumulés se rapprochent ainsi davantage de l'expérience utilisateur réelle.

OpenRouter offre un autre type d'environnement de test.

Les développeurs connectent le modèle à divers Agents de codage, le font entrer dans des dépôts réels, appeler continuellement des outils, et traiter des tâches de génie logiciel pouvant durer plusieurs heures. La stabilité du contexte, la fiabilité des appels d'outils, la possibilité que le modèle tourne en rond ou dévie pendant des tâches longues, tout cela peut être rapidement exposé lors d'une utilisation intensive.

Pour les éditeurs de modèles, cela équivaut à un test de résistance public. Les équipes peuvent observer à l'avance les cas d'échec, vérifier la capacité de charge du service d'inférence, et également accumuler une réputation réelle avant la publication officielle.

De plus, « deviner le modèle » devient de plus en plus un outil de marketing ; le suspense sur l'identité peut effectivement prolonger le cycle des discussions.

Pour en revenir au modèle lui-même. Si Ox Alpha est vraiment un modèle Flash dont les capacités en codage se rapprochent déjà du niveau des leaders, où pourrait nous mener la version complète, avec plus de ressources et des capacités plus abouties ?

Liens de référence :

https://x.com/Adidotdev/status/2090833298713096241

https://x.com/davis7/status/2090669483740279155?s=20

https://x.com/davis7/status/2090655207831298095?s=20

https://x.com/MaxForAI/status/2090783750217162788

Cet article provient du compte officiel WeChat « Machine Heart » (ID : almosthuman2014), auteur : Suivre l'IA.

Questions liées

QQu'est-ce que l'Ox Alpha, et pourquoi est-il surnommé '牛来' en ligne ?

AOx Alpha est un modèle de langage anonyme récemment apparu sur OpenRouter. Comme 'Ox' signifie 'bœuf', les internautes chinois lui ont donné le surnom humoristique de '牛来', ce qui peut se traduire par 'Le Bœuf Arrive' ou 'Voilà le Bœuf'.

QQuelle est la capacité de traitement de contexte d'Ox Alpha et quels types d'entrées prend-il en charge ?

ASelon les informations d'OpenRouter, Ox Alpha possède un contexte de 1 million de tokens et prend en charge les entrées de texte, d'image et de vidéo. Il peut également appeler des outils et est actuellement entièrement gratuit.

QQuels sont les arguments principaux avancés pour suggérer qu'Ox Alpha pourrait être un modèle de Zhipu (GLM) ?

APlusieurs indices pointent vers Zhipu AI : 1) La consommation de tokens visuels pour la vidéo est identique à celle du GLM-5V-Turbo. 2) Le nombre de tokens textuels présente un écart constant avec le GLM-5.3. 3) Le modèle refuse de traiter l'audio, comme le fait GLM-5V. 4) Son style de réponse et son interface de raisonnement sont similaires. 5) Zhipu a déjà testé anonymement des modèles comme Pony Alpha par le passé.

QQuel autre modèle anonyme est testé sur Code Arena en parallèle, et quelles sont les spéculations sur son origine ?

AUn autre modèle anonyme nommé 'korrine' est testé sur Code Arena. Les spéculations incluent qu'il pourrait s'agir de la version K3.1 de Kimi (Moonshot AI), d'un nouveau modèle de Qwen ou de la version V3 de MiMo. Son origine reste très incertaine.

QPourquoi les développeurs de grands modèles de langage procèdent-ils à des tests anonymes ('sous couverture') ?

ALes tests anonymes servent plusieurs objectifs : 1) Éliminer les préjugés liés à la marque pour obtenir des évaluations plus objectives. 2) Effectuer des tests de stress en conditions réelles, par exemple dans des agents de codage, pour révéler les problèmes sur de longues tâches. 3) Accumuler des retours et une réputation avant la sortie officielle. 4) Cela peut aussi être une stratégie marketing, créant du suspense et prolongant les discussions.

Lectures associées

Bitwise CIO Matt : Si vous avez actuellement une configuration crypto de 0 %, cela équivaut à être activement baissier sur le marché

Matt Hougan, CIO de Bitwise, analyse la dynamique actuelle du marché cryptographique malgré une baisse de 50% depuis les sommets. Il souligne l'engagement persistant de Wall Street, citant le lancement de fonds tokenisés par BlackRock malgré les retards réglementaires comme le CLARITY Act. Hougan estime que ce projet de loi restera dans un état d'incertitude, mais que l'industrie avancera sans lui, soutenue par les grandes institutions financières. Il observe un changement de comportement du Bitcoin, désormais résistant aux mauvaises nouvelles, signe pour lui de la fin d'un marché baissier. Concernant l'investissement, il explique que le DCA (moyenne par coût) est une assurance comportementale, mais qu'une entrée immédiate est justifiée pour les rendements absolus, anticipant une reprise. Hougan note que les grandes plateformes de gestion de patrimoine (Wells Fargo, UBS) considèrent désormais la crypto comme une classe d'actifs à part entière, se focalisant sur le long terme. Il met en avant les opportunités de la gestion d'actifs on-chain et du thème de la tokenisation d'actifs réels (RWA), bénéfiques pour Ethereum, Solana et Chainlink. Son conseil principal : une allocation de 5% en crypto est un "repas gratuit", améliorant significativement les rendements sans augmenter la volatilité globale du portefeuille. À l'inverse, une allocation de 0% n'est pas une position neutre, mais un pari actif très baissier sur l'avenir de cette classe d'actifs.

marsbitIl y a 45 mins

Bitwise CIO Matt : Si vous avez actuellement une configuration crypto de 0 %, cela équivaut à être activement baissier sur le marché

marsbitIl y a 45 mins

À l'instant, le premier match de tennis humain-machine au monde s'est déroulé, un robot a effectué un sauvetage limite, laissant Zheng Jie stupéfaite

Le premier match de tennis humain-robot au monde a eu lieu lors des deuxièmes Jeux mondiaux des robots humanoïdes, diffusé en direct par la télévision centrale de Chine. Le robot humanoïde "Galaxy Star仔" de Galaxy General Robotics a affronté la championne de tennis Zheng Jie en simple, après avoir participé à un double mixte. Le robot a démontré des capacités remarquables : déplacement agile, échanges fluides, service à plus de 100 km/h, et récupération de balles difficiles. Il a même réussi à se relever rapidement après une chute. Cette performance représente un point de rupture dans l'intelligence incarnée, testant en temps réel les limites de la perception, de la prise de décision, du contrôle moteur et de l'adaptation dans un environnement physique dynamique et imprévisible, bien plus complexe que les jeux de stratégie comme les échecs ou le Go. Cette réussite s'appuie sur le modèle d'intelligence incarnée "Galaxy AstraBrain", qui intègre dans une même architecture les fonctions de décision de haut niveau ("cerveau") et de contrôle moteur fin ("cervelet"), éliminant ainsi les délais de communication. Le robot a été entraîné en deux étapes : d'abord par apprentissage à partir de données imparfaites de joueurs humains, puis par un entraînement intensif en simulation où plusieurs agents s'affrontaient, permettant l'émergence autonome de compétences comme le sauvetage extrême ou la technique pour se relever. Cet événement "AstraTennis" marque le passage de l'IA d'un monde numérique à la maîtrise du monde physique, symbolisant les avancées de la Chine dans l'ère de la symbiose carbone-silicium.

marsbitIl y a 1 h

À l'instant, le premier match de tennis humain-machine au monde s'est déroulé, un robot a effectué un sauvetage limite, laissant Zheng Jie stupéfaite

marsbitIl y a 1 h

Soudain, DeepSeek annonce des tarifs creux le week-end, travailler le samedi et dimanche deviendrait plus avantageux ?

DeepSeek a annoncé une modification de sa tarification par période de pointe et creuse pour ses API, effective à partir du 23 août. Désormais, les week-ends (samedi et dimanche) seront entièrement facturés au tarif creux, sans distinction d'heure. Cette décision, généralement bien accueillie par les développeurs qui peuvent ainsi réduire leurs coûts en exécutant des tâches batch le week-end, suscite également des inquiétudes parmi les salariés. En effet, certaines industries, comme celle des mini-séries, ont déjà commencé à ajuster les horaires de travail pour profiter des périodes de calcul AI moins chères. Des cas sont rapportés où des entreprises modifient les plannings, voire imposent du travail le week-end, pour optimiser les dépenses en tokens. Les raisons de ce changement tarifaire font débat. Une hypothèse avance que les prix de pointe correspondent aux périodes d'entraînement des modèles par DeepSeek, libérant la capacité de calcul le week-end. D'autres remettent en cause cette logique, arguant que l'entraînement des modèles est hautement automatisé. Alors que la nouvelle grille tarifaire est en vigueur, la question des impacts à long terme sur l'organisation du travail et des potentielles économies réelles, compte tenu des coûts de coordination supplémentaires, reste ouverte.

marsbitIl y a 1 h

Soudain, DeepSeek annonce des tarifs creux le week-end, travailler le samedi et dimanche deviendrait plus avantageux ?

marsbitIl y a 1 h

Dans les paiements par IA, le plus grand outsider est peut-être Coinbase, qui a donné un portefeuille aux Agents

Alors que les débats sur les protocoles de paiement AI se concentrent souvent sur les géants comme Visa ou Stripe, Coinbase émerge comme un acteur majeur sur le terrain, devenant la plus grande plateforme opérationnelle pour les paiements d'agents. Les données de 2026 révèlent que plus de 90% des transactions d'agents sur chaîne ont lieu sur Base (sa couche 2), 99% des transactions commerciales d'agents sont réglées en USDC, et plus de 97% utilisent le protocole x402. La clé du positionnement de Coinbase réside dans le lancement des "Agentic Wallets" en février 2026. Plutôt que de simplement connecter les agents aux réseaux de paiement existants, cette infrastructure fournit aux agents une identité financière propre, leur permettant de détenir des actifs (comme des stablecoins) et d'effectuer des transactions autonomes, micro-débitées et fréquentes entre machines. Cela résout les problèmes des cartes (frais élevés, autorisations manuelles, traçabilité floue) pour ce type de flux. Coinbase contrôle un écosystème fermé pour ces paiements : la chaîne Base, le protocole x402, les portefeuilles dédiés et les actifs comme l'USDC. Ce qui semblait être une convergence fortuite de ses investissements antérieurs dans l'infrastructure blockchain s'est révélé être un avantage décisif lorsque l'économie des agents a explosé. La leçon est que l'adoption dans les paiements AI peut moins dépendre de la bataille des standards que de la disponibilité immédiate d'une infrastructure utilisable. Coinbase, en ayant ses pièces déjà en place, a capturé la première vague de demande réelle.

marsbitIl y a 2 h

Dans les paiements par IA, le plus grand outsider est peut-être Coinbase, qui a donné un portefeuille aux Agents

marsbitIl y a 2 h

Dalio alerte sur le déséquilibre offre-demande des obligations américaines : L'or et le bitcoin pourraient servir d'actifs de couverture contre une crise de la dette

Dans son livre "Les Grands Cycles: Comment les Nations Font Faillite", Ray Dalio détaille le mécanisme classique des crises de dette souveraine, déclenchées par un déséquilibre insoutenable entre l'offre et la demande de dette d'État. Il observe actuellement trois signaux alarmants aux États-Unis : des ventes de bons du Trésor par le Japon, des rendements obligataires américains en hausse malgré un dollar faible (indiquant une offre excédentaire et une demande affaiblie), et des achats limités de dette par le Trésor américain lui-même. Dalio explique que lorsqu'un gouvernement doit emprunter massivement pour rembourser ses dettes existantes (les intérêts annuels US sont de ~1 000 mds $, le service total de la dette atteint ~200% des recettes), et que la demande du marché ne suit pas, deux issues sont possibles : une hausse destructrice des taux d'intérêt ou la monétisation de la dette par la banque centrale, conduisant à une dépréciation monétaire et à l'inflation. Il compare cela à une "crise cardiaque" économique. Pour les États-Unis (déficit de ~2 000 mds $, dette de 32 000 mds $), Dalio propose une "solution en trois parties à 3%" équilibrant réduction des dépenses, augmentation des recettes et baisse des taux pour réduire le déficit à 3% du PIB. Sans correction, il estime qu'une crise pourrait survenir dans environ trois ans (± deux ans). En conclusion, face aux risques de dévaluation monétaire généralisée chez les grandes économies endettées (États-Unis, UE, Japon, Royaume-Uni, Chine), Dalio recommande aux investisseurs de diversifier leurs actifs internationaux, de sous-pondérer les obligations, et de surpondérer l'or (allouer 10-15% du portefeuille) avec une petite exposition au Bitcoin comme couverture contre la dépréciation des monnaies fiduciaires.

marsbitIl y a 2 h

Dalio alerte sur le déséquilibre offre-demande des obligations américaines : L'or et le bitcoin pourraient servir d'actifs de couverture contre une crise de la dette

marsbitIl y a 2 h

Trading

Spot
活动图片