¡Hoy, esta pelea fue demasiado alucinante!
Por un lado, Liang Wenfeng finalmente lanzó la versión oficial de DeepSeek V4 Pro en la madrugada.
Por otro lado, Musk presentó el próximo buque insignia Grok 4.6, destacándose por su bajo costo y alto rendimiento.
Dos gigantes, lanzados al mismo tiempo, la tensión subió instantáneamente.

Ambos tienen la vista puesta en casi lo mismo:
Permitir que los modelos puedan, en tareas largas, usar herramientas de manera continua, modificar código, verificar resultados y finalmente entregar un producto realmente funcional.
Llegó DeepSeek V4 Pro
El reto de Musk: Grok 4.6
El resultado más destacado de la versión oficial de DeepSeek V4 Pro fue conseguir el primer puesto absoluto en dos evaluaciones, superando directamente a Fable 5.
En la prueba de agente de ciberseguridad CyberGym obtuvo 83.3 puntos, superando los 83.1 de Fable 5 y los 78.3 de Opus 4.8.
En la prueba de tareas automatizadas AutomationBench obtuvo 31.8 puntos, dejando atrás los 29.1 de Fable 5 y los 27.2 de Opus 4.8.
El momento más "cara a cara" ocurrió en Terminal-Bench 2.1.
DeepSeek obtuvo 87.9 puntos, superando los 85.0 de Opus 4.8, y solo estuvo a 0.1 punto de los 88.0 de Fable 5.
En otras pruebas difíciles de agente, DeepSeek logró una ventaja absoluta sobre Opus 4.8.
En la "última prueba humana" con herramientas obtuvo 60.0 puntos, superando los 57.9 de Opus 4.8 y acercándose a los 63.0 de Fable 5.
Incluso en la tarea más débil hasta ahora, la de agente de ingeniería de software DeepSWE, pasó de 12.8 puntos en la versión preliminar a 62.7 puntos, casi 4.9 veces más.
Este resultado no solo supera los 58.0 puntos de Opus 4.8, sino que está a solo 7.3 puntos de los 70.0 de Fable 5.

Al mismo tiempo, Musk también puso a Fable 5 y GPT-5.6 Sol en el banquillo.
Grok 4.6 primero igualó a GPT-5.6 en capacidad integral, y luego lo superó continuamente en pruebas de codificación.
En el Índice de Inteligencia Integral obtuvo 61 puntos, a solo 1 punto de los 62 de Fable 5.
En CursorBench obtuvo 69.9%, superando el 67.2% de GPT-5.6 y estando a solo 0.6 puntos porcentuales del 70.5% de Fable 5.
En FrontierCode obtuvo 61.3%, también superando el 60.6% de GPT-5.6 y persiguiendo de cerca el 63.6% de Fable 5.
En tareas de trabajo intelectual más cercanas a las entregas profesionales reales, Grok 4.6 dio la vuelta y superó a los demás, consiguiendo el primer puesto en las tres evaluaciones.
En GDPval-AA v2 obtuvo 1753 Elo, superando los 1741 de Fable 5 y los 1728 de GPT-5.6.
En AA-Briefcase obtuvo 1577 Elo, superando los 1574 de Fable 5 y los 1502 de GPT-5.6.
En la tarea legal profesional Harvey LAB obtuvo 15.8%, mientras que Fable 5 solo tuvo 11.3% y GPT-5.6 apenas 2.5%.

Lo más sorprendente es que DeepSeek V4 Pro y Grok 4.6 no solo se acercan en rendimiento a los modelos más avanzados de OpenAI y Anthropic, sino que juntos han reducido el precio de la inteligencia de vanguardia.
Por cada millón de Tokens de salida, Grok 4.6 cuesta 6 dólares, GPT-5.6 Sol 30 dólares, Claude Opus 5 25 dólares y Fable 5 50 dólares.
¡Mientras que DeepSeek solo cuesta 0.87 dólares—
¡Aproximadamente 1/7 del precio de Grok 4.6, 1/35 de GPT-5.6 Sol, 1/29 de Claude Opus 5 y 1/57 de Fable 5!


Primeras pruebas en la red
DeepSeek contra Grok
Ahora, ya están disponibles las primeras pruebas reales. DeepSeek V4 Pro y Grok 4.6 finalmente han pasado del ranking de puntuaciones al campo de tareas reales.
En la primera ronda, le dimos intensidad a DeepSeek.
Con solo un prompt, creó desde cero en el navegador un globo terráqueo 3D interactivo completo.
Las interacciones básicas como arrastrar, rotar y hacer zoom estaban todas disponibles; los flujos de datos globales, las rutas dinámicas y las marcas geográficas también se desplegaron completamente en la superficie terrestre.
Mirando más los detalles, la dispersión atmosférica, el renderizado de nubes, las luces y sombras día/noche, e incluso toda la interfaz de usuario, también estaban completas.

A continuación, pusimos a los dos modelos en el mismo ring.
El blogger de IA "向阳乔木" primero ejecutó tres pequeñas tareas con DeepSeek V4 Pro, luego le dio los mismos prompts de dos de esas tareas a Grok 4.6, comparando directamente los productos finales.
La primera tarea fue usar 3 Skills para desarrollar e implementar un sitio web.
DeepSeek completó con éxito todo el proceso, y en términos de diseño de página y grado de finalización, el rendimiento general fue muy estable.
La segunda tarea fue replicar 60 estilos de diseño y generar un conjunto completo de tarjetas Bento para mostrarlas juntas.
En esta ronda, DeepSeek hizo distinciones claras en tipografía, combinación de colores y maquetación, con un efecto visual general bastante bueno.
La última tarea fue generar desde cero un juego 3D de "romper ladrillos".
El juego no solo se podía jugar directamente, sino que también incluía escenarios tridimensionales, música de fondo y efectos de sonido dinámicos, con retroalimentación en la jugabilidad y diversión completas.



Luego, los mismos prompts se dieron a Grok 4.6.
En la ronda del juego 3D de romper ladrillos, los dos modelos estuvieron casi empatados.
El juego generado por Grok también tenía una buena calidad visual, y tanto los efectos visuales, la integridad del escenario como la jugabilidad no tenían nada que envidiar a DeepSeek V4 Pro.
En la ronda de los 60 diseños Bento, Grok 4.6 recuperó un punto.
Algunas de las páginas que generó eran más maduras en términos de maquetación, combinación de colores y jerarquía visual, y el efecto final era más atractivo.


El duelo más intenso ocurrió en Flappy Bird.
El desarrollador Jun Song dio exactamente el mismo prompt, pidiendo a DeepSeek V4 Pro y Grok 4.6 que "crearan a mano" desde cero un juego.
El resultado fue que los dos modelos tomaron rutas completamente diferentes.
DeepSeek V4 Pro consumió más de 20,000 Tokens, con un costo de solo 0.019 dólares; Grok 4.6 usó solo unos 5,000 Tokens, pero su costo fue de 0.03 dólares.

Pero mirando el producto final, DeepSeek fue claramente superior en esta ronda.
El juego no solo tenía montañas en la distancia y nubes superpuestas, sino que los tubos también tenían degradados y sensación de volumen. Cuando el personaje pasaba por un tubo, la pantalla incluso mostraba una animación flotante de "+1".
Desde la jerarquía del escenario hasta la retroalimentación de la operación, los detalles estaban casi al máximo, y el grado de finalización de la construcción de extremo a extremo era claramente superior al de Grok 4.6.
En otra prueba de front-end realizada por el desarrollador Hamza, DeepSeek V4 Pro volvió a superar a Grok 4.6.
Ya fuera en el grado de finalización de la página o en el efecto visual final, el producto entregado por V4 Pro era superior.

Sin embargo, V4 Pro tampoco fue impecable en todas las rondas.
En una prueba comparativa de un pelícano, en comparación con la versión Flash, la integridad general de la imagen de V4 Pro era mayor, y la forma del elefante era más estética.
El único problema fue que la dirección del movimiento del pelícano estaba completamente invertida.

Aumentando la dificultad, al hacer que DeepSeek V4 Pro, GPT-5.6 Sol y Claude Opus 5 usaran Three.js para generar el mismo cerezo, la diferencia se hizo más evidente.
Ya fuera en los detalles del tronco y las ramas, o en la iluminación, la profundidad de campo y la atmósfera general, V4 Pro no igualaba a los otros dos modelos avanzados.



DeepSeek V4 Pro; GPT-5.6 Sol; Claude Opus 5
Después de ver varias rondas de pruebas reales, DeepSeek V4 Pro y Grok 4.6 realmente han alcanzado el mismo nivel, es difícil distinguir cuál es mejor.
Dos IAs en el mismo día
alcanzaron a OpenAI y Anthropic
Sobre la explosión simultánea de estos dos modelos, el experto Rick De Oliveira dio la siguiente evaluación: "Potentes, y asequibles."
Con el apoyo de DeepSeek V4 Pro y Grok 4.6, estas dos palabras que casi nunca aparecen juntas, hoy, por primera vez, realmente se han unido.
Desde ciberseguridad y tareas de conocimiento hasta agentes que resuelven problemas de forma autónoma, ya han roto el techo de las capacidades de vanguardia en múltiples frentes, y con un costo menor.

Mirando hacia atrás en esta alucinante "batalla" de IA de hoy, DeepSeek y Grok han reescrito conjuntamente una regla del juego:
La inteligencia de punta ya no es inalcanzable.
En el pasado, los desarrolladores a menudo tenían que elegir entre "no poder pagarlo" y "no ser lo suficientemente potente".
Y hoy, DeepSeek ha volcado la mesa con un precio de solo unas pocas décimas del SOTA, y Grok le sigue de cerca con una relación calidad-precio extremadamente alta.
Este impacto frontal de "alta capacidad y bajo precio" ya ha abierto una brecha en el viejo orden.

Y la guerra no ha terminado.
Musk ya ha anunciado que Grok 4.7 llegará pronto, con el objetivo de superar a todas las IA de punta; la contraofensiva de OpenAI y Anthropic también llegará sin falta.


Viviendo en esta era que evoluciona por "horas", la inteligencia ya no es un privilegio de unos pocos gigantes, la gran explosión de aplicaciones para todos acaba de comenzar.
Referencias:
https://api-docs.deepseek.com/zh-cn/quick_start/pricing/
https://x.ai/news/grok-4-6
https://x.com/vista8/status/2087577905081823559
https://x.com/vista8/status/2087566666477744620
https://x.com/jun_song/status/2087602149979254914
Este artículo proviene del WeChat público "新智元", autor: ASI启示录, editor: Moisés Taozi






