Mysterious "Ox Alpha" Large Model Goes Viral with Limited-Time Free Access

marsbitPublié le 2026-08-23Dernière mise à jour le 2026-08-23

Résumé

A mysterious anonymous AI model named "Ox Alpha," nicknamed "Cow is Coming" by Chinese netizens, has appeared on OpenRouter, sparking widespread speculation. The model offers a 1 million token context, supports text, image, and video inputs, can call tools, and is currently free. Its standout feature is strong coding ability. Initial tests on the DeepSWE benchmark, which evaluates real-world software engineering tasks, showed an 80% pass rate on a subset of tasks, reportedly nearing top-tier code models. However, follow-up tests yielded a 63% score, with variations attributed to different task sets and configurations. The model's true developer is a major topic of debate. The prevailing theory points to Zhipu AI's unreleased GLM-5.3 Flash or its multimodal variant. Evidence cited includes identical visual token consumption patterns with GLM-5V-Turbo for videos, a consistent offset in text token counts compared to GLM-5.3, and similar behavioral traits like refusing audio processing. Zhipu has a precedent of anonymous testing. Simultaneously, another anonymous model, "korrine," appeared on Code Arena, with guesses ranging from Moonshot's Kimi K3.1 to models from Qwen or MiMo, adding to the industry's guessing game. This trend of anonymous "undercover" testing allows for unbiased performance evaluation in platforms like Arena and provides real-world, high-pressure testing through tools like OpenRouter before official release. It also serves as an effective marketing tactic,...

It's trendy to test large models with 'anonymous accounts'.

Recently, an anonymous model named Ox Alpha suddenly appeared on OpenRouter. Ox means 'ox' or 'cow', and domestic netizens quickly gave it a more relatable nickname:

"Ox Comes" large model.

According to information disclosed by OpenRouter, Ox Alpha has a 1 million token context window, supports text, image, and video input, can call tools, and is currently completely free.

Shortly after launch, developers integrated it into a coding agent and threw it into a real code repository for testing.

Preliminary test results show that this mysterious "Ox Comes" large model's capabilities are already approaching current top-tier code models.

Meanwhile, netizens revealed that an anonymous model named korrine is being tested on Code Arena. Some speculate it's Kimi K3.1, while others point to Qwen and MiMo, with varied guesses.

In August, the large model circle has suddenly turned into a large-scale guessing game.

"Ox Comes" Model Performs Remarkably

What truly drew attention to Ox Alpha was its coding capability.

Developer Ben Davis selected 10 tasks from DeepSWE for testing, and Ox Alpha completed 8 of them, achieving an 80% pass rate. In his published comparison results, Fable 5 Max scored 65%, GLM-5.3 Max and Grok 4.6 xhigh both scored 62%, and GPT-5.6 Sol Max scored 52%.

DeepSWE examines real-world software engineering ability. The model needs to read code repositories, locate problems, modify code, run tests, and continue fixing based on error reports. Compared to single-round coding problems, it's closer to the actual work of a coding Agent.

However, 10 tasks is a very small sample. Subsequently, other developers tested on another subset of DeepSWE, reporting a result of about 63%. The task scopes and execution configurations of the two tests were not identical, making it impossible to definitively rank Ox Alpha based on this alone.

Nevertheless, these results preliminarily show that this anonymous model has demonstrated strong potential for long-context coding, with capabilities approaching current leading models.

Who Created the "Ox Comes" Large Model?

The most widespread speculation about the identity of the "Ox Comes" model is that it is an unreleased GLM-5.3 Flash from Zhipu AI, or a multimodal version of GLM-5.3.

Someone even wrote a blog to analyze this:

1. The strongest evidence comes from the video encoder. For four videos with different frame rates, durations, and resolutions, the visual tokens consumed by Ox Alpha matched exactly with GLM-5V-Turbo. MiMo, Qwen, and GLM-4.6V all showed significantly different results.

2. The text tokenizer also shows a high degree of alignment. The researcher tested 25 sets of prompts; the token count between Ox Alpha and GLM-5.3 consistently maintained a fixed difference of 75 tokens.

3. Other features also point to Zhipu AI. Ox Alpha refuses to process audio, which matches the routing method of GLM-5V; its answer style, the number of Agent execution steps, and the inference interface are also very similar to GLM. Zhipu AI previously used Pony Alpha for anonymous testing of GLM-5, establishing a precedent for this practice.

https://ox-alpha-evidence-production.up.railway.app/

Other netizens have also found clues in conversations.

Ben Davis believes he is 99% certain this is GLM-5.x.

These clues increase the credibility of the GLM theory, but are still insufficient for definitive identity confirmation.

As of now, neither OpenRouter nor Zhipu AI have publicly responded.

korrine's Identity is Even More Mysterious

While the identity of the "Ox Comes" model remains unclear, another anonymous model named korrine has appeared on Code Arena.

Initially, many speculated it was Kimi K3.1, because before the release of Kimi K3, it was believed to have been tested under the codename kivine. The similar structure of kivine and korrine sparked this association.

However, the original source of the rumor later added that the previously learned about new Moonshot model might correspond to another codename, adamant-ananke. korrine could also come from other Chinese teams like Qwen.

In the comments, some also pointed to MiMo V3.

Why Do Large Model Companies Like 'Testing in Disguise'?

Anonymous testing is becoming an important step before the official release of large models.

Hiding the manufacturer and model name in the Arena can minimize preconceptions brought by branding. Users cannot see the model's identity and can only choose based on actual outputs. The accumulated battle results are also closer to the real user experience.

OpenRouter provides a different kind of testing environment.

Developers integrate the model into various coding Agents, letting it enter real repositories, continuously call tools, and handle software engineering tasks lasting several hours. Issues like context stability, tool calling reliability, and whether the model gets stuck in loops or goes off track during long tasks can be quickly exposed under intense use.

For model developers, this is akin to a public stress test. Teams can observe failure cases in advance, verify the capacity of their inference services, and also accumulate real-world reputation before official launch.

Moreover, "guessing the model" is increasingly becoming a marketing tactic; the suspense over identity can indeed prolong the discussion cycle.

Finally, back to the model itself. If Ox Alpha is truly a Flash model and its coding ability is already approaching top-tier levels, where will the ceiling be pushed by the more resource-intensive, more capable full version?

Reference Links:

https://x.com/Adidotdev/status/2090833298713096241

https://x.com/davis7/status/2090669483740279155?s=20

https://x.com/davis7/status/2090655207831298095?s=20

https://x.com/MaxForAI/status/2090783750217162788

This article is from the WeChat public account "Almost Human" (ID: almosthuman2014), author: Following AI

Questions liées

QWhat is the name of the anonymous model discussed in the article that appeared on OpenRouter, and why did it capture significant attention?

AThe anonymous model discussed is named 'Ox Alpha' (nicknamed 'Niu Lai' by Chinese netizens). It captured significant attention primarily due to its impressive performance on real-world software engineering tasks, specifically in coding tests like DeepSWE where it achieved high pass rates, showing capabilities approaching top-tier code models.

QAccording to the article's investigation, which company is the leading candidate for being behind the 'Ox Alpha' model, and what evidence supports this claim?

AThe leading candidate suggested in the article is Zhipu AI, possibly an unreleased GLM-5.3 Flash or a multimodal version of GLM-5.3. Supporting evidence includes: 1) Its video encoder's visual token consumption perfectly matches GLM-5V-Turbo, 2) Its text tokenizer shows a fixed token count offset compared to GLM-5.3, and 3) Other behavioral traits, such as refusing to process audio, align with Zhipu's GLM models. The company also has a precedent for anonymous testing.

QBesides 'Ox Alpha', what is the name of the other anonymous model mentioned in the article that is being tested on Code Arena, and what are some speculations about its origin?

AThe other anonymous model mentioned is named 'korrine', tested on Code Arena. Speculations about its origin include that it could be Moonshot AI's upcoming Kimi K3.1 (due to a similar earlier test codename), a model from Qwen, or MiMo V3. The article states its identity is even more mysterious than that of Ox Alpha.

QWhat are the two main benefits for AI model companies to conduct anonymous testing, as explained in the article?

AThe article explains two main benefits: 1) It allows for unbiased evaluation by removing brand bias, enabling users to judge models based solely on performance, leading to results that better reflect real user experience. 2) It serves as a public stress test, helping companies identify failure cases, verify the capacity of their inference services, and build genuine user reputation before an official launch.

QWhat specific capability of the 'Ox Alpha' model was tested using the DeepSWE benchmark, and what was one of its notable performance results mentioned?

AThe 'Ox Alpha' model was tested on its real-world software engineering capability using the DeepSWE benchmark, which requires tasks like reading code repositories, locating issues, modifying code, and running tests. One notable result mentioned was that in an initial test of 10 tasks by a developer, Ox Alpha completed 8, achieving an 80% pass rate, which was higher than several other top models in the comparison.

Lectures associées

Dernier discours de Warsh : Notre époque

Discours de Kevin Wash, président de la Fed, à Jackson Hole : "In Our Time". Il souligne la résilience de l'économie et du marché du travail américains, et juge que l'environnement financier n'est pas clairement restrictif. L'inflation restant nettement supérieure à l'objectif de 2%, elle doit rester la priorité absolue de la politique monétaire. Wash insiste : il faut avoir confiance que l'inflation sous-jacente se dirige clairement et suffisamment vite vers la cible, sinon "nous avons encore du travail à faire". Il estime que les récentes données sur les prix, bien que meilleures que prévu, ne signalent pas une amélioration significative de la tendance inflationniste. Wash critique également les "orientations prospectives" (forward guidance) en période normale, arguant qu'elles peuvent limiter la flexibilité de la Fed et créer un problème de "salle des miroirs" où les marchés et les décideurs s'influencent mutuellement au détriment d'une analyse objective. Il privilégie une approche basée sur les données et des principes solides. Il aborde l'impact de l'IA, une nouvelle variable potentielle de production, sur laquelle la Fed mène des recherches. Enfin, il énonce plusieurs principes clés : se baser sur des données actuelles et des tendances, poursuivre fermement la stabilité des prix (objectif de 2% du PCE) et le plein emploi, utiliser principalement les taux d'intérêt comme outil, et reconnaître l'importance de la monnaie. Il conclut en réaffirmant l'engagement de la Fed à remplir son mandat avec discipline et détermination.

marsbitIl y a 41 mins

Dernier discours de Warsh : Notre époque

marsbitIl y a 41 mins

Les premières données du fisc britannique (HMRC) sur les cryptomonnaies montrent qu'une grande partie des bénéfices est détenue par une minorité d'hommes jeunes

Les premières données détaillées du fisc britannique (HMRC) sur les plus-values en cryptomonnaies révèlent une concentration marquée parmi une minorité jeune et masculine. Pour l'année fiscale 2024-2025, 17 600 contribuables ont déclaré une plus-value imposable de 1,38 milliard de livres sterling provenant de la vente de crypto-actifs. Un groupe de seulement 240 individus, ayant gagné plus d'un million de livres chacun, a capté à lui seul 717 millions de livres, soit plus de la moitié du total des gains, bien qu'il représente moins de 2% des déclarants. La majorité (65%) des déclarants ont réalisé des profits modestes, inférieurs à 25 000 livres, ne représentant que 7% des gains totaux. Le profil des investisseurs est très distinct : 87% des déclarants étaient des hommes, qui ont généré 93% de tous les profits. De plus, ils sont significativement plus jeunes que l'investisseur type en capital ; 81% ont moins de 54 ans, et le groupe des 25-44 ans constitue 54% des déclarants crypto, contre 17% pour l'ensemble des contribuables à l'impôt sur les plus-values. Ces données, désormais disponibles grâce à une case dédiée dans la déclaration, préfigurent un contrôle fiscal renforcé. Le HMRC a intensifié ses rappels et, dès 2027, commencera à recevoir automatiquement des données sur les clients des plateformes cryptos, conformément aux normes internationales de l'OCDE, rendant la dissimulation beaucoup plus difficile.

cryptonews.ruIl y a 3 h

Les premières données du fisc britannique (HMRC) sur les cryptomonnaies montrent qu'une grande partie des bénéfices est détenue par une minorité d'hommes jeunes

cryptonews.ruIl y a 3 h

Accès aux sessions actives au lieu des bases de données : comment le marché parallèle a évolué en Russie

Le marché noir des données en Russie a changé de priorité : au lieu de vendre des bases de données massives volées, les criminels ciblent désormais l'accès actif et à court terme aux comptes d'utilisateurs. La valeur des informations interceptées par des logiciels malveillants a augmenté de près de 13% sur un an. Les données dites "fraîches", comme les jetons de session actifs, les mots de passe en cours, les accès VPN ou administrateurs, sont bien plus recherchées que les archives obsolètes. Une souscription à un canal privé fournissant ces données quotidiennement peut coûter jusqu'à 300$ par mois. Alors que la réglementation russe (via le Roskomnadzor) a réussi à réduire les fuites massives de bases de données en imposant de lourdes amendes aux entreprises, cette approche est inefficace contre la nouvelle menace. Les logiciels malveillants volent désormais les données une fois qu'elles ont quitté le périmètre sécurisé de l'entreprise et sont sur l'appareil personnel de l'utilisateur, un espace où les mécanismes de responsabilité administrative ne s'appliquent pas. Cette méthode permet de contourner les protections comme l'authentification à deux facteurs. Un ordinateur infecté peut ainsi ouvrir un réseau d'entreprise. Le phénomène révèle un décalage entre l'intention des régulateurs et la réalité technique, similaire à ce qui a été observé au niveau international avec des marchés comme Genesis Market, fermé en 2023. La demande pour des données actuelles incite également les opérateurs de botnets à maintenir les appareils infectés actifs plus longtemps comme source de revenus récurrents, créant une zone de vulnérabilité persistante entre l'appareil personnel et l'infrastructure d'entreprise.

cryptonews.ruIl y a 3 h

Accès aux sessions actives au lieu des bases de données : comment le marché parallèle a évolué en Russie

cryptonews.ruIl y a 3 h

Bitfinex signale le début d’une tendance haussière pour les prix du Bitcoin, parallèlement à des corrélations record avec l’or

Les analystes de Bitfinex signalent que le bitcoin commence à adopter un comportement similaire à celui de l'"or numérique", alors que les investisseurs cherchent à se protéger contre l'endettement et les manipulations monétaires. La corrélation entre l'or et le bitcoin a atteint des sommets, niveaux qui ne se maintiennent généralement pas longtemps, ce qui pourrait indiquer un changement de tendance imminent. Bitfinex souligne que les deux actifs sont traités comme des couvertures contre la dépréciation monétaire, le bitcoin agissant comme une version à plus haut bêta. L'évolution de ce rapport dépendra de l'environnement de risque : le bitcoin restera-t-il aligné sur l'or ou chutera-t-il avec les actions ? Ce contexte macroéconomique évolue, passant de l'engouement pour l'IA à des trades axés sur la dépréciation, influencés par les actions du Trésor américain et les préoccupations liées à la dette. La plateforme note également que le prix du bitcoin est sorti de sa phase d'accumulation pour entrer dans une phase de croissance, selon son indicateur Delta-Thermo Market Multiple. La configuration actuelle rappelle celle du début 2024, où les craintes d'une "dévalorisation de la dette" stimulaient l'intérêt pour les actifs alternatifs. Cependant, le président de la Fed de Kansas City, Kevin Warsh, a récemment adopté une position ferme, réaffirmant l'objectif d'inflation à 2% et laissant entrevoir de potentielles hausses de taux.

cryptonews.ruIl y a 3 h

Bitfinex signale le début d’une tendance haussière pour les prix du Bitcoin, parallèlement à des corrélations record avec l’or

cryptonews.ruIl y a 3 h

Trading

Spot
活动图片