El misterioso modelo de gran tamaño «Ox Alpha» causa sensación, gratuito por tiempo limitado

marsbitPublicado a 2026-08-23Actualizado a 2026-08-23

Resumen

El misterioso modelo de IA "Ox Alpha", apodado "Llega el Buey", está causando revuelo al aparecer de forma anónima en OpenRouter, ofreciéndose de forma gratuita y limitada. Con un contexto de 1 millón de tokens y capacidades multimodales (texto, imagen, video), ha llamado la atención por su destacado rendimiento en tareas de programación. En pruebas iniciales del benchmark DeepSWE, que evalúa habilidades reales de ingeniería de software, logró una tasa de éxito del 80%, aproximándose a los principales modelos de código actuales, aunque resultados posteriores sugieren un 63%. Su identidad es un enigma. La evidencia más fuerte apunta a que podría ser una versión no lanzada de Zhipu AI, posiblemente GLM-5.3 Flash o una variante multimodal. Las pistas incluyen similitudes exactas en el tokenizador visual y de texto con modelos GLM, así como estilos de respuesta y comportamientos de agente similares. Mientras tanto, otro modelo anónimo llamado "korrine" aparece en Code Arena, con especulaciones que lo vinculan a Kimi, Qwen o MiMo. Este fenómeno de pruebas anónimas o "con identidad oculta" permite una evaluación más objetiva, libre de sesgos de marca, y sirve como una prueba de estrés pública para los desarrolladores antes del lanzamiento oficial. También se ha convertido en una efectiva herramienta de marketing que genera expectación. Si "Llega el Buey" es efectivamente un modelo "Flash" (optimizado en eficiencia), su alto rendimiento sugiere que las versiones completas podrían ...

En el mundo de los modelos de gran tamaño está de moda realizar pruebas bajo «seudónimos».

Recientemente, un modelo anónimo llamado Ox Alpha apareció repentinamente en OpenRouter. Ox significa «buey» o «toro», y los internautas chinos pronto le dieron un nombre más familiar:

El modelo de gran tamaño «牛来» (Niu Lai, que suena como «viene el toro»).

Según la información divulgada por OpenRouter, Ox Alpha tiene un contexto de 1 millón de tokens, admite entrada de texto, imágenes y vídeo, puede utilizar herramientas y, por el momento, es completamente gratuito.

Poco después de su lanzamiento, los desarrolladores lo integraron en un agente de codificación y lo sometieron a pruebas en repositorios de código reales.

Los resultados iniciales de las pruebas muestran que este misterioso modelo «牛来» ya tiene unas capacidades que se acercan a las de los mejores modelos de código actuales.

Al mismo tiempo, algunos usuarios revelaron que un modelo anónimo llamado korrine está siendo probado en Code Arena. Algunos especulan que podría ser Kimi K3.1, mientras que otros lo relacionan con Qwen y MiMo, hay todo tipo de teorías.

El mundo de los modelos de gran tamaño en agosto se ha convertido repentinamente en un gran juego de adivinanzas.

El modelo «牛来» destaca por su rendimiento

Lo que realmente llamó la atención sobre Ox Alpha fue su capacidad en código.

El desarrollador Ben Davis seleccionó 10 tareas de DeepSWE para realizar pruebas, y Ox Alpha completó 8 de ellas, logrando una tasa de éxito del 80%. En los resultados comparativos publicados, Fable 5 Max obtuvo un 65%, GLM-5.3 Max y Grok 4.6 xhigh un 62%, y GPT-5.6 Sol Max un 52%.

DeepSWE evalúa capacidades reales de ingeniería de software. El modelo debe leer un repositorio de código, localizar problemas, modificar el código, ejecutar pruebas y continuar corrigiendo según los errores. En comparación con los problemas de programación de una sola ronda, se acerca más al trabajo real de un agente de codificación.

Sin embargo, 10 tareas es una muestra muy pequeña. Posteriormente, otros desarrolladores realizaron pruebas en otro subconjunto de DeepSWE, arrojando un resultado de aproximadamente el 63%. El alcance de las tareas y la configuración de ejecución de las dos pruebas no fueron idénticos, por lo que aún no es posible determinar con exactitud la posición precisa de Ox Alpha basándose en esto.

No obstante, estos resultados muestran preliminarmente que este modelo anónimo ya exhibe un gran potencial para la codificación de larga duración, acercándose a los principales modelos actuales.

¿A quién pertenece realmente el modelo «牛来»?

En cuanto a la identidad del modelo «牛来», la teoría más extendida actualmente es que se trata de GLM-5.3 Flash, aún no lanzado por Zhipu AI, o una versión multimodal de GLM-5.3.

Incluso alguien escribió un blog analizándolo:

1. La evidencia más sólida proviene del codificador de vídeo. En cuatro vídeos con diferentes tasas de fotogramas, duraciones y resoluciones, el consumo de tokens visuales de Ox Alpha coincidió exactamente con el de GLM-5V-Turbo. MiMo, Qwen y GLM-4.6V mostraron resultados notablemente diferentes.

2. El tokenizador de texto también coincide notablemente. Los investigadores probaron 25 conjuntos de prompts, y la cantidad de tokens entre Ox Alpha y GLM-5.3 siempre mantuvo una diferencia fija de 75 tokens.

3. Otras características también apuntan a Zhipu. Ox Alpha rechaza procesar audio, de la misma manera que GLM-5V maneja el enrutamiento; su estilo de respuesta, el número de pasos de ejecución del agente y la interfaz de razonamiento también son similares a los de GLM. Además, Zhipu ya había probado previamente GLM-5 de forma anónima bajo el nombre Pony Alpha, siguiendo la misma práctica.

https://ox-alpha-evidence-production.up.railway.app/

Otros usuarios también encontraron pistas en los diálogos.

Ben Davis cree estar un 99% seguro de que se trata de GLM-5.x.

Estas pistas aumentan la credibilidad de la teoría GLM, pero aún no son suficientes para confirmar la identidad.

Hasta la fecha, ni OpenRouter ni Zhipu AI han hecho declaraciones públicas al respecto.

La identidad de korrine es aún más misteriosa

Mientras la identidad del modelo «牛来» sigue siendo un misterio, en Code Arena ha aparecido otro modelo anónimo llamado korrine.

Inicialmente, muchos especularon que podría ser Kimi K3.1, ya que antes del lanzamiento de Kimi K3, se creía que había sido probado bajo el nombre en código kivine. kivine y korrine tienen estructuras similares, lo que generó esta asociación.

Sin embargo, la persona que filtró la información inicialmente añadió más tarde que el nuevo modelo de Moonshot del que tenía conocimiento podría corresponder a otro nombre en código, adamant-ananke. Korrine también podría provenir de otros equipos chinos, como Qwen.

En los comentarios, también hubo quien lo vinculó a MiMo V3.

¿Por qué a los fabricantes de modelos de gran tamaño les gusta usar «seudónimos»?

Las pruebas anónimas se están convirtiendo en una parte importante del proceso previo al lanzamiento oficial de los modelos de gran tamaño.

Ocultar el fabricante y el modelo en las Arenas ayuda a minimizar los prejuicios causados por la marca. Los usuarios no pueden ver la identidad del modelo y solo pueden elegir basándose en la salida real, acumulando así resultados de combate que se acercan más a la experiencia real del usuario.

OpenRouter ofrece otro tipo de entorno de prueba.

Los desarrolladores integran el modelo en varios agentes de codificación, lo introducen en repositorios reales, lo hacen utilizar herramientas de forma continua y manejar tareas de ingeniería de software que duran horas. La estabilidad del contexto, la fiabilidad de las llamadas a herramientas, y si el modelo entra en bucles o se desvía en tareas de larga duración, todo puede quedar expuesto rápidamente bajo un uso intensivo.

Para los fabricantes de modelos, esto equivale a una prueba de estrés pública. Los equipos pueden observar de antemano casos de fallo, verificar la capacidad de carga del servicio de inferencia y también acumular reputación real antes del lanzamiento oficial.

Además, «adivinar el modelo» se está convirtiendo cada vez más en una estrategia de marketing, ya que el suspense sobre la identidad puede prolongar el ciclo de discusión.

Finalmente, volviendo al modelo en sí. Si Ox Alpha es realmente un modelo Flash y su capacidad en código ya se acerca a la de los mejores, ¿hasta dónde podría llegar la versión completa, con más recursos y capacidades más integrales?

Referencias:

https://x.com/Adidotdev/status/2090833298713096241

https://x.com/davis7/status/2090669483740279155?s=20

https://x.com/davis7/status/2090655207831298095?s=20

https://x.com/MaxForAI/status/2090783750217162788

Este artículo proviene del WeChat Official Account «机器之心» (ID:almosthuman2014), autor: 关注AI的

Preguntas relacionadas

Q¿Qué es el modelo '牛来' y por qué ha generado interés en la comunidad?

AEl modelo '牛来' es un modelo anónimo (también conocido como Ox Alpha) que apareció en OpenRouter. Ha generado interés debido a su capacidad para manejar 1 millón de tokens de contexto, soporte para entrada de texto, imágenes y video, capacidad para usar herramientas y porque actualmente es completamente gratuito.

QSegún el artículo, ¿qué características del modelo '牛来' apuntan a que podría ser un producto de Zhipu AI?

ALas características que apuntan a Zhipu AI son: el tokenizador visual coincide exactamente con el de GLM-5V-Turbo; hay una diferencia constante de 75 tokens en el tokenizador de texto respecto a GLM-5.3; rechaza procesar audio, al igual que GLM-5V; y el estilo de respuesta y la interfaz de inferencia son similares a los modelos GLM. Además, Zhipu tiene un precedente de usar nombres anónimos como 'Pony Alpha' para pruebas.

Q¿Qué es DeepSWE y qué resultados obtuvo '牛来' en las pruebas iniciales con esta metodología?

ADeepSWE es una evaluación que prueba capacidades reales de ingeniería de software. El modelo debe leer repositorios de código, localizar problemas, modificar código, ejecutar pruebas y corregir errores sucesivamente. En las pruebas iniciales con 10 tareas, el modelo '牛来' completó 8, logrando una tasa de aprobación del 80%.

QAdemás de '牛来', ¿qué otro modelo anónimo se menciona en el artículo y cuáles son las especulaciones sobre su origen?

AEl otro modelo anónimo mencionado es 'korrine', que se está probando en Code Arena. Se especula que podría ser Kimi K3.1, un nuevo modelo de Qwen o la versión V3 de MiMo, pero su origen sigue siendo incierto.

QSegún el artículo, ¿por qué los desarrolladores de modelos de lenguaje grandes realizan pruebas anónimas o 'con seudónimo'?

ALas pruebas anónimas permiten obtener evaluaciones más objetivas al eliminar sesgos de marca, sirven como pruebas de estrés en entornos reales antes del lanzamiento oficial para identificar fallos y validar la capacidad del servicio, y también funcionan como una estrategia de marketing al generar expectación y alargar el ciclo de discusión en torno al modelo.

Lecturas Relacionadas

La hija de Jensen Huang, de chef a 8 millones de yuanes al año

Hija de Jensen Huang, Madison Huang, visitó Beijing durante la Cumbre Mundial de Robots 2026, recorriendo empresas como Yuejiang, Lingang Intelligence y Ubtech. La "heredera de Nvidia", nacida en los 90, es actualmente directora sénior de marketing de producto y tecnología para la plataforma de IA física de Nvidia, con un salario anual de aproximadamente 1,2 millones de dólares (8,3 millones de RMB). Su trayectoria es inusual: estudió cocina, trabajó como chef y luego en LVMH antes de unirse a Nvidia como pasante en 2020, ascendiendo rápidamente. Su hermano Spencer siguió un camino similar. Jensen Huang ha defendido la contratación de hijos de empleados, bromeando sobre que algunos superan a sus padres. Su visita coincide con un momento crucial para la industria robótica china. La empresa Unitree debutó en bolsa, y muchas otras como Fourier Intelligence y Leju Robotics avanzan hacia OPVs. Más allá del rápido crecimiento en volumen (más de 40.000 unidades de humanoides enviadas en el primer semestre), el enfoque ahora está en desarrollar la "inteligencia" de los robots para que comprendan y operen en entornos desconocidos, la próxima frontera de la "IA física" en la que Nvidia está apostando fuertemente. China, con su ecosistema manufacturero y sus vastos escenarios de aplicación, se ha convertido en un campo de pruebas y competencia central para esta nueva ola tecnológica.

marsbitHace 20 min(s)

La hija de Jensen Huang, de chef a 8 millones de yuanes al año

marsbitHace 20 min(s)

Le dio a Wang Xingxing los primeros 2 millones, y ahora asume como presidente del siguiente "Unitree"

El 19 de agosto, la compañía china de robótica Unitree (宇树科技), conocida como la "primera acción de robots humanoides" en el mercado de valores A, salió a bolsa. Una figura clave tras este éxito es Yin Fangming, quien en 2016 invirtió 2 millones de RMB como capital ángel cuando el fundador Wang Xingxing tenía dificultades para financiarse. Esta inversión inicial, que llegó a alcanzar retornos de más de 140 veces, fue crucial para el despegue de Unitree. Yin Fangming, además de inversor, fue cofundador de la empresa de robótica e IA ROOBO. Aunque esta última no logró el éxito esperado y enfrentó dificultades financieras, su experiencia le permitió reconocer el potencial de Unitree, valorando su enfoque en hardware de alto rendimiento y bajo costo. Con el tiempo, Yin vendió parte de su participación en Unitree, obteniendo ganancias que reinvirtió en sectores como energía, baterías de estado sólido y aeroespacial comercial. Recientemente, Yin Fangming asumió un rol más público al convertirse en presidente de Galaxy General (银河通用), un unicornio de inteligencia embodied (corporizada) fundado en 2023 y valorado en más de 200 mil millones de RMB. Este movimiento sugiere una apuesta estratégica por la próxima generación de empresas de robótica, que combinan hardware avanzado con capacidades de IA. Con una trayectoria que pasó por la industria móvil en empresas como Sougou y Qihoo 360, Yin ha demostrado una constante búsqueda de "lo próximo" en tecnología. A pesar de sus logros, mantiene un perfil bajo, declinando entrevistas y pidiendo que el foco permanezca en emprendedores como Wang Xingxing. Su historia refleja la evolución del ecosistema tecnológico chino, desde internet móvil hasta la vanguardia de la robótica y la IA.

marsbitHace 33 min(s)

Le dio a Wang Xingxing los primeros 2 millones, y ahora asume como presidente del siguiente "Unitree"

marsbitHace 33 min(s)

Reflexión sobre el robo de Coldcard: Código fuente visible no equivale a seguridad

Reflexión sobre el robo de Coldcard: Código visible no equivale a seguridad. El reciente robo de más de 1500 BTC de carteras hardware Coldcard expone límites del "código abierto". El firmware de Coldcard, bajo licencia MIT con restricciones comerciales, es "código visible" pero no completamente de código abierto (FOSS/FLOSS). Esto redujo los incentivos para una auditoría externa profunda, dejando un error crítico sin detectar durante ~5 años. El verdadero código abierto, definido por libertades como uso, estudio, modificación y distribución, crea la *posibilidad* de verificación, pero no la garantía. La seguridad depende de que existan incentivos económicos y atención humana para auditar. Proyectos como Bitcoin Core, desarrollado de forma transparente y colaborativa, ejemplifican el modelo. La economía del código abierto enfrenta la "tragedia de los comunes": los usuarios suponen que "otros auditan", pero sin incentivos alineados, la revisión falla. Las licencias restrictivas limitan el grupo de auditores potenciales. La IA está cambiando el equilibrio: herramientas como Bitcoin Red Team usan IA para escanear repositorios a gran velocidad, encontrando vulnerabilidades críticas. Simultáneamente, la generación de código por IA aumenta la carga para los mantenedores de proyectos FOSS. La ventaja de seguridad por oscuridad (código cerrado) se erosiona frente a las capacidades analíticas de la IA. En conclusión, la visibilidad del código fuente es solo un primer paso. La seguridad en Bitcoin, donde los errores se traducen directamente en pérdidas financieras, requiere una combinación de licencias que fomenten la auditoría, incentivos económicos para revisores competentes y, potencialmente, el uso de nuevas herramientas como la IA para análisis a escala. Solo los proyectos rigurosamente auditados sobrevivirán.

marsbitHace 45 min(s)

Reflexión sobre el robo de Coldcard: Código fuente visible no equivale a seguridad

marsbitHace 45 min(s)

Los ETF spot de Bitcoin y Ethereum atraen 2.600 millones de dólares en una semana: récord desde octubre de 2025

Los ETF de Bitcoin y Ethereum registraron una entrada neta de 2.600 millones de dólares la semana pasada, el mayor flujo semanal desde octubre de 2025, según SoSoValue. Los ETF de Bitcoin captaron 1.900 millones de dólares, mientras que los de Ethereum sumaron 697,2 millones. Este resultado supone un cambio radical respecto a la salida de 392 millones de dólares de la semana anterior. El volumen de negociación de los ETF de Bitcoin se triplicó, superando los 22.100 millones de dólares, y sus activos gestionados crecieron un 25,4%, hasta los 96.100 millones. El mayor impulso se produjo los días 19 y 20 de agosto, destacando el fondo IBIT de BlackRock con una entrada diaria de 503 millones el 20 de agosto. Los ETF de Ethereum también tuvieron su mejor semana desde octubre de 2025, con un volumen de negociación que aumentó un 259,4%, hasta los 6.900 millones de dólares. Sus activos gestionados crecieron un 35,9%, hasta los 14.300 millones. A pesar de esta fuerte semana, los ETF de Bitcoin y Ethereum siguen mostrando salidas netas en 2026 de unos 2.900 millones y 191,8 millones de dólares, respectivamente. El análisis de la estructura del flujo revela una alta concentración en un solo fondo (IBIT de BlackRock), lo que, según una perspectiva de IA, introduce una vulnerabilidad, ya que un cambio de sentimiento en un actor principal podría revertir rápidamente la tendencia actual.

cryptonews.ruHace 56 min(s)

Los ETF spot de Bitcoin y Ethereum atraen 2.600 millones de dólares en una semana: récord desde octubre de 2025

cryptonews.ruHace 56 min(s)

Trading

Spot
活动图片