En el mundo de los modelos de gran tamaño está de moda realizar pruebas bajo «seudónimos».
Recientemente, un modelo anónimo llamado Ox Alpha apareció repentinamente en OpenRouter. Ox significa «buey» o «toro», y los internautas chinos pronto le dieron un nombre más familiar:
El modelo de gran tamaño «牛来» (Niu Lai, que suena como «viene el toro»).
Según la información divulgada por OpenRouter, Ox Alpha tiene un contexto de 1 millón de tokens, admite entrada de texto, imágenes y vídeo, puede utilizar herramientas y, por el momento, es completamente gratuito.

Poco después de su lanzamiento, los desarrolladores lo integraron en un agente de codificación y lo sometieron a pruebas en repositorios de código reales.
Los resultados iniciales de las pruebas muestran que este misterioso modelo «牛来» ya tiene unas capacidades que se acercan a las de los mejores modelos de código actuales.
Al mismo tiempo, algunos usuarios revelaron que un modelo anónimo llamado korrine está siendo probado en Code Arena. Algunos especulan que podría ser Kimi K3.1, mientras que otros lo relacionan con Qwen y MiMo, hay todo tipo de teorías.
El mundo de los modelos de gran tamaño en agosto se ha convertido repentinamente en un gran juego de adivinanzas.
El modelo «牛来» destaca por su rendimiento
Lo que realmente llamó la atención sobre Ox Alpha fue su capacidad en código.
El desarrollador Ben Davis seleccionó 10 tareas de DeepSWE para realizar pruebas, y Ox Alpha completó 8 de ellas, logrando una tasa de éxito del 80%. En los resultados comparativos publicados, Fable 5 Max obtuvo un 65%, GLM-5.3 Max y Grok 4.6 xhigh un 62%, y GPT-5.6 Sol Max un 52%.

DeepSWE evalúa capacidades reales de ingeniería de software. El modelo debe leer un repositorio de código, localizar problemas, modificar el código, ejecutar pruebas y continuar corrigiendo según los errores. En comparación con los problemas de programación de una sola ronda, se acerca más al trabajo real de un agente de codificación.
Sin embargo, 10 tareas es una muestra muy pequeña. Posteriormente, otros desarrolladores realizaron pruebas en otro subconjunto de DeepSWE, arrojando un resultado de aproximadamente el 63%. El alcance de las tareas y la configuración de ejecución de las dos pruebas no fueron idénticos, por lo que aún no es posible determinar con exactitud la posición precisa de Ox Alpha basándose en esto.

No obstante, estos resultados muestran preliminarmente que este modelo anónimo ya exhibe un gran potencial para la codificación de larga duración, acercándose a los principales modelos actuales.
¿A quién pertenece realmente el modelo «牛来»?
En cuanto a la identidad del modelo «牛来», la teoría más extendida actualmente es que se trata de GLM-5.3 Flash, aún no lanzado por Zhipu AI, o una versión multimodal de GLM-5.3.
Incluso alguien escribió un blog analizándolo:
1. La evidencia más sólida proviene del codificador de vídeo. En cuatro vídeos con diferentes tasas de fotogramas, duraciones y resoluciones, el consumo de tokens visuales de Ox Alpha coincidió exactamente con el de GLM-5V-Turbo. MiMo, Qwen y GLM-4.6V mostraron resultados notablemente diferentes.
2. El tokenizador de texto también coincide notablemente. Los investigadores probaron 25 conjuntos de prompts, y la cantidad de tokens entre Ox Alpha y GLM-5.3 siempre mantuvo una diferencia fija de 75 tokens.
3. Otras características también apuntan a Zhipu. Ox Alpha rechaza procesar audio, de la misma manera que GLM-5V maneja el enrutamiento; su estilo de respuesta, el número de pasos de ejecución del agente y la interfaz de razonamiento también son similares a los de GLM. Además, Zhipu ya había probado previamente GLM-5 de forma anónima bajo el nombre Pony Alpha, siguiendo la misma práctica.

https://ox-alpha-evidence-production.up.railway.app/
Otros usuarios también encontraron pistas en los diálogos.

Ben Davis cree estar un 99% seguro de que se trata de GLM-5.x.

Estas pistas aumentan la credibilidad de la teoría GLM, pero aún no son suficientes para confirmar la identidad.
Hasta la fecha, ni OpenRouter ni Zhipu AI han hecho declaraciones públicas al respecto.
La identidad de korrine es aún más misteriosa
Mientras la identidad del modelo «牛来» sigue siendo un misterio, en Code Arena ha aparecido otro modelo anónimo llamado korrine.
Inicialmente, muchos especularon que podría ser Kimi K3.1, ya que antes del lanzamiento de Kimi K3, se creía que había sido probado bajo el nombre en código kivine. kivine y korrine tienen estructuras similares, lo que generó esta asociación.

Sin embargo, la persona que filtró la información inicialmente añadió más tarde que el nuevo modelo de Moonshot del que tenía conocimiento podría corresponder a otro nombre en código, adamant-ananke. Korrine también podría provenir de otros equipos chinos, como Qwen.

En los comentarios, también hubo quien lo vinculó a MiMo V3.

¿Por qué a los fabricantes de modelos de gran tamaño les gusta usar «seudónimos»?
Las pruebas anónimas se están convirtiendo en una parte importante del proceso previo al lanzamiento oficial de los modelos de gran tamaño.
Ocultar el fabricante y el modelo en las Arenas ayuda a minimizar los prejuicios causados por la marca. Los usuarios no pueden ver la identidad del modelo y solo pueden elegir basándose en la salida real, acumulando así resultados de combate que se acercan más a la experiencia real del usuario.
OpenRouter ofrece otro tipo de entorno de prueba.
Los desarrolladores integran el modelo en varios agentes de codificación, lo introducen en repositorios reales, lo hacen utilizar herramientas de forma continua y manejar tareas de ingeniería de software que duran horas. La estabilidad del contexto, la fiabilidad de las llamadas a herramientas, y si el modelo entra en bucles o se desvía en tareas de larga duración, todo puede quedar expuesto rápidamente bajo un uso intensivo.
Para los fabricantes de modelos, esto equivale a una prueba de estrés pública. Los equipos pueden observar de antemano casos de fallo, verificar la capacidad de carga del servicio de inferencia y también acumular reputación real antes del lanzamiento oficial.
Además, «adivinar el modelo» se está convirtiendo cada vez más en una estrategia de marketing, ya que el suspense sobre la identidad puede prolongar el ciclo de discusión.
Finalmente, volviendo al modelo en sí. Si Ox Alpha es realmente un modelo Flash y su capacidad en código ya se acerca a la de los mejores, ¿hasta dónde podría llegar la versión completa, con más recursos y capacidades más integrales?
Referencias:
https://x.com/Adidotdev/status/2090833298713096241
https://x.com/davis7/status/2090669483740279155?s=20
https://x.com/davis7/status/2090655207831298095?s=20
https://x.com/MaxForAI/status/2090783750217162788
Este artículo proviene del WeChat Official Account «机器之心» (ID:almosthuman2014), autor: 关注AI的





