Liang Wenfeng sorprendió a Musk, DeepSeek V4 Pro contra Grok 4.6, la primera prueba fue explosiva

marsbitPublicado a 2026-08-12Actualizado a 2026-08-12

Resumen

Avances en IA: DeepSeek V4 Pro y Grok 4.6 rivalizan con modelos líderes a un costo reducido DeepSeek V4 Pro y Grok 4.6 se lanzaron simultáneamente, desafiando a modelos como GPT-5.6, Claude Opus 5 y Fable 5 en diversas pruebas. DeepSeek V4 Pro destacó en CyberGym (83.3 puntos) y AutomationBench (31.8 puntos), superando a sus competidores. Grok 4.6 igualó a GPT-5.6 en capacidad general (61 puntos) y lideró en tareas prácticas como GDPval-AA v2 (1753 Elo) y Harvey LAB (15.8%). Ambos modelos ofrecen un alto rendimiento a bajo costo: DeepSeek V4 Pro cuesta 0.87 USD por millón de tokens de salida, mientras que Grok 4.6 cuesta 6 USD, significativamente menos que los modelos de OpenAI y Anthropic. Pruebas prácticas demostraron capacidades similares en desarrollo web, diseño y creación de juegos. Aunque DeepSeek V4 Pro generó un Flappy Bird más detallado, Grok 4.6 produjo diseños visualmente superiores en algunas tareas. Ambos acercan la IA avanzada a un público más amplio, combinando potencia y accesibilidad, lo que podría transformar el panorama tecnológico.

¡Hoy, esta pelea fue demasiado alucinante!

Por un lado, Liang Wenfeng finalmente lanzó la versión oficial de DeepSeek V4 Pro en la madrugada.

Por otro lado, Musk presentó el próximo buque insignia Grok 4.6, destacándose por su bajo costo y alto rendimiento.

Dos gigantes, lanzados al mismo tiempo, la tensión subió instantáneamente.

Ambos tienen la vista puesta en casi lo mismo:

Permitir que los modelos puedan, en tareas largas, usar herramientas de manera continua, modificar código, verificar resultados y finalmente entregar un producto realmente funcional.

Llegó DeepSeek V4 Pro

El reto de Musk: Grok 4.6

El resultado más destacado de la versión oficial de DeepSeek V4 Pro fue conseguir el primer puesto absoluto en dos evaluaciones, superando directamente a Fable 5.

En la prueba de agente de ciberseguridad CyberGym obtuvo 83.3 puntos, superando los 83.1 de Fable 5 y los 78.3 de Opus 4.8.

En la prueba de tareas automatizadas AutomationBench obtuvo 31.8 puntos, dejando atrás los 29.1 de Fable 5 y los 27.2 de Opus 4.8.

El momento más "cara a cara" ocurrió en Terminal-Bench 2.1.

DeepSeek obtuvo 87.9 puntos, superando los 85.0 de Opus 4.8, y solo estuvo a 0.1 punto de los 88.0 de Fable 5.

En otras pruebas difíciles de agente, DeepSeek logró una ventaja absoluta sobre Opus 4.8.

En la "última prueba humana" con herramientas obtuvo 60.0 puntos, superando los 57.9 de Opus 4.8 y acercándose a los 63.0 de Fable 5.

Incluso en la tarea más débil hasta ahora, la de agente de ingeniería de software DeepSWE, pasó de 12.8 puntos en la versión preliminar a 62.7 puntos, casi 4.9 veces más.

Este resultado no solo supera los 58.0 puntos de Opus 4.8, sino que está a solo 7.3 puntos de los 70.0 de Fable 5.

Al mismo tiempo, Musk también puso a Fable 5 y GPT-5.6 Sol en el banquillo.

Grok 4.6 primero igualó a GPT-5.6 en capacidad integral, y luego lo superó continuamente en pruebas de codificación.

En el Índice de Inteligencia Integral obtuvo 61 puntos, a solo 1 punto de los 62 de Fable 5.

En CursorBench obtuvo 69.9%, superando el 67.2% de GPT-5.6 y estando a solo 0.6 puntos porcentuales del 70.5% de Fable 5.

En FrontierCode obtuvo 61.3%, también superando el 60.6% de GPT-5.6 y persiguiendo de cerca el 63.6% de Fable 5.

En tareas de trabajo intelectual más cercanas a las entregas profesionales reales, Grok 4.6 dio la vuelta y superó a los demás, consiguiendo el primer puesto en las tres evaluaciones.

En GDPval-AA v2 obtuvo 1753 Elo, superando los 1741 de Fable 5 y los 1728 de GPT-5.6.

En AA-Briefcase obtuvo 1577 Elo, superando los 1574 de Fable 5 y los 1502 de GPT-5.6.

En la tarea legal profesional Harvey LAB obtuvo 15.8%, mientras que Fable 5 solo tuvo 11.3% y GPT-5.6 apenas 2.5%.

Lo más sorprendente es que DeepSeek V4 Pro y Grok 4.6 no solo se acercan en rendimiento a los modelos más avanzados de OpenAI y Anthropic, sino que juntos han reducido el precio de la inteligencia de vanguardia.

Por cada millón de Tokens de salida, Grok 4.6 cuesta 6 dólares, GPT-5.6 Sol 30 dólares, Claude Opus 5 25 dólares y Fable 5 50 dólares.

¡Mientras que DeepSeek solo cuesta 0.87 dólares—

¡Aproximadamente 1/7 del precio de Grok 4.6, 1/35 de GPT-5.6 Sol, 1/29 de Claude Opus 5 y 1/57 de Fable 5!

Primeras pruebas en la red

DeepSeek contra Grok

Ahora, ya están disponibles las primeras pruebas reales. DeepSeek V4 Pro y Grok 4.6 finalmente han pasado del ranking de puntuaciones al campo de tareas reales.

En la primera ronda, le dimos intensidad a DeepSeek.

Con solo un prompt, creó desde cero en el navegador un globo terráqueo 3D interactivo completo.

Las interacciones básicas como arrastrar, rotar y hacer zoom estaban todas disponibles; los flujos de datos globales, las rutas dinámicas y las marcas geográficas también se desplegaron completamente en la superficie terrestre.

Mirando más los detalles, la dispersión atmosférica, el renderizado de nubes, las luces y sombras día/noche, e incluso toda la interfaz de usuario, también estaban completas.

A continuación, pusimos a los dos modelos en el mismo ring.

El blogger de IA "向阳乔木" primero ejecutó tres pequeñas tareas con DeepSeek V4 Pro, luego le dio los mismos prompts de dos de esas tareas a Grok 4.6, comparando directamente los productos finales.

La primera tarea fue usar 3 Skills para desarrollar e implementar un sitio web.

DeepSeek completó con éxito todo el proceso, y en términos de diseño de página y grado de finalización, el rendimiento general fue muy estable.

La segunda tarea fue replicar 60 estilos de diseño y generar un conjunto completo de tarjetas Bento para mostrarlas juntas.

En esta ronda, DeepSeek hizo distinciones claras en tipografía, combinación de colores y maquetación, con un efecto visual general bastante bueno.

La última tarea fue generar desde cero un juego 3D de "romper ladrillos".

El juego no solo se podía jugar directamente, sino que también incluía escenarios tridimensionales, música de fondo y efectos de sonido dinámicos, con retroalimentación en la jugabilidad y diversión completas.

Luego, los mismos prompts se dieron a Grok 4.6.

En la ronda del juego 3D de romper ladrillos, los dos modelos estuvieron casi empatados.

El juego generado por Grok también tenía una buena calidad visual, y tanto los efectos visuales, la integridad del escenario como la jugabilidad no tenían nada que envidiar a DeepSeek V4 Pro.

En la ronda de los 60 diseños Bento, Grok 4.6 recuperó un punto.

Algunas de las páginas que generó eran más maduras en términos de maquetación, combinación de colores y jerarquía visual, y el efecto final era más atractivo.

El duelo más intenso ocurrió en Flappy Bird.

El desarrollador Jun Song dio exactamente el mismo prompt, pidiendo a DeepSeek V4 Pro y Grok 4.6 que "crearan a mano" desde cero un juego.

El resultado fue que los dos modelos tomaron rutas completamente diferentes.

DeepSeek V4 Pro consumió más de 20,000 Tokens, con un costo de solo 0.019 dólares; Grok 4.6 usó solo unos 5,000 Tokens, pero su costo fue de 0.03 dólares.

Pero mirando el producto final, DeepSeek fue claramente superior en esta ronda.

El juego no solo tenía montañas en la distancia y nubes superpuestas, sino que los tubos también tenían degradados y sensación de volumen. Cuando el personaje pasaba por un tubo, la pantalla incluso mostraba una animación flotante de "+1".

Desde la jerarquía del escenario hasta la retroalimentación de la operación, los detalles estaban casi al máximo, y el grado de finalización de la construcción de extremo a extremo era claramente superior al de Grok 4.6.

En otra prueba de front-end realizada por el desarrollador Hamza, DeepSeek V4 Pro volvió a superar a Grok 4.6.

Ya fuera en el grado de finalización de la página o en el efecto visual final, el producto entregado por V4 Pro era superior.

Sin embargo, V4 Pro tampoco fue impecable en todas las rondas.

En una prueba comparativa de un pelícano, en comparación con la versión Flash, la integridad general de la imagen de V4 Pro era mayor, y la forma del elefante era más estética.

El único problema fue que la dirección del movimiento del pelícano estaba completamente invertida.

Aumentando la dificultad, al hacer que DeepSeek V4 Pro, GPT-5.6 Sol y Claude Opus 5 usaran Three.js para generar el mismo cerezo, la diferencia se hizo más evidente.

Ya fuera en los detalles del tronco y las ramas, o en la iluminación, la profundidad de campo y la atmósfera general, V4 Pro no igualaba a los otros dos modelos avanzados.

DeepSeek V4 Pro; GPT-5.6 Sol; Claude Opus 5

Después de ver varias rondas de pruebas reales, DeepSeek V4 Pro y Grok 4.6 realmente han alcanzado el mismo nivel, es difícil distinguir cuál es mejor.

Dos IAs en el mismo día

alcanzaron a OpenAI y Anthropic

Sobre la explosión simultánea de estos dos modelos, el experto Rick De Oliveira dio la siguiente evaluación: "Potentes, y asequibles."

Con el apoyo de DeepSeek V4 Pro y Grok 4.6, estas dos palabras que casi nunca aparecen juntas, hoy, por primera vez, realmente se han unido.

Desde ciberseguridad y tareas de conocimiento hasta agentes que resuelven problemas de forma autónoma, ya han roto el techo de las capacidades de vanguardia en múltiples frentes, y con un costo menor.

Mirando hacia atrás en esta alucinante "batalla" de IA de hoy, DeepSeek y Grok han reescrito conjuntamente una regla del juego:

La inteligencia de punta ya no es inalcanzable.

En el pasado, los desarrolladores a menudo tenían que elegir entre "no poder pagarlo" y "no ser lo suficientemente potente".

Y hoy, DeepSeek ha volcado la mesa con un precio de solo unas pocas décimas del SOTA, y Grok le sigue de cerca con una relación calidad-precio extremadamente alta.

Este impacto frontal de "alta capacidad y bajo precio" ya ha abierto una brecha en el viejo orden.

Y la guerra no ha terminado.

Musk ya ha anunciado que Grok 4.7 llegará pronto, con el objetivo de superar a todas las IA de punta; la contraofensiva de OpenAI y Anthropic también llegará sin falta.

Viviendo en esta era que evoluciona por "horas", la inteligencia ya no es un privilegio de unos pocos gigantes, la gran explosión de aplicaciones para todos acaba de comenzar.

Referencias:

https://api-docs.deepseek.com/zh-cn/quick_start/pricing/

https://x.ai/news/grok-4-6

https://x.com/vista8/status/2087577905081823559

https://x.com/vista8/status/2087566666477744620

https://x.com/jun_song/status/2087602149979254914

Este artículo proviene del WeChat público "新智元", autor: ASI启示录, editor: Moisés Taozi

Criptos en tendencia

Preguntas relacionadas

Q¿Qué dos modelos de IA se presentaron de manera prominente en el artículo y quiénes están detrás de ellos?

ALos dos modelos de IA destacados son DeepSeek V4 Pro, liderado por Liang Wenfeng, y Grok 4.6, desarrollado por el equipo de Elon Musk en xAI.

QEn las pruebas de referencia, ¿en qué áreas específicas sobresalió DeepSeek V4 Pro frente a modelos como Fable 5 y Opus 4.8?

ADeepSeek V4 Pro obtuvo el primer lugar en CyberGym (83.3 puntos) y AutomationBench (31.8 puntos). También mostró mejoras significativas en DeepSWE, alcanzando 62.7 puntos, superando a Opus 4.8 y acercándose a Fable 5.

QSegún el artículo, ¿cuál es una ventaja de coste clave de DeepSeek V4 Pro en comparación con otros modelos de IA líderes?

ADeepSeek V4 Pro tiene un coste extremadamente bajo de 0.87 dólares por millón de tokens de salida, que es aproximadamente 1/7 del precio de Grok 4.6, 1/35 de GPT-5.6 Sol y 1/57 de Fable 5.

QEn la prueba práctica de creación del juego Flappy Bird, ¿en qué aspectos superó DeepSeek V4 Pro a Grok 4.6 según los resultados?

AAunque DeepSeek V4 Pro utilizó más tokens (coste total 0.019$), su versión del juego Flappy Bird tenía más detalles, como montañas en el fondo, nubes, tubos con degradado y efectos de animación (como '+1' al pasar los tubos), mostrando una mayor integridad y calidad visual.

Q¿Qué impacto sugiere el artículo que tendrá la llegada de estos modelos potentes y asequibles en el panorama de la IA?

AEl artículo sugiere que estos modelos 'potentes y asequibles' están rompiendo el techo de costes de la IA de vanguardia, haciendo que la inteligencia avanzada ya no sea inalcanzable. Esto podría iniciar una explosión de aplicaciones accesibles para todos y cambiar las reglas del juego, presionando a otros actores importantes como OpenAI y Anthropic.

Lecturas Relacionadas

Estrategia Global de Mercados de J.P. Morgan: ¿Los productos básicos actuales se parecen a los de 2022?

El estratega global de mercado de JPMorgan analiza la posible similitud entre el entorno actual de materias primas y el de 2022, anticipando un nuevo ciclo de subidas de tasas por parte de la Fed. Históricamente, las materias primas han tenido rendimientos positivos durante los ciclos de endurecimiento, excepto en el último (2022-2023), donde cayeron un 14% debido a la reducción de la prima de riesgo por la oferta rusa y a factores industriales adversos. Aunque el contexto de la Fed podría parecerse al de 1999, el mercado de materias primas se asemeja más al de 2022, con precios cerca de máximos históricos y presiones inflacionarias vinculadas a disrupciones en la cadena de suministro, como los bloqueos en el Estrecho de Ormuz. El principal riesgo es que una nueva disminución de la prima por interrupciones, combinada con un endurecimiento financiero, pueda enfriar el sector. El análisis por sectores señala que la energía depende críticamente del flujo por Ormuz y la demanda china, con un pronóstico base bajista pero riesgos alcistas significativos. Los metales preciosos, especialmente el oro, son muy sensibles a las expectativas de subidas de tasas y podrían enfrentar presiones a la baja. Por otro lado, los metales industriales, en particular el cobre, se muestran sólidos debido a la fortaleza manufacturera global y a inventarios bajos, aunque son vulnerables a un giro más agresivo de la Fed.

marsbitHace 29 min(s)

Estrategia Global de Mercados de J.P. Morgan: ¿Los productos básicos actuales se parecen a los de 2022?

marsbitHace 29 min(s)

Opus 5 supera el ARC-AGI-3, el 'arnés' se está convirtiendo en la cuerda que ata al modelo

**Resumen: Opus 5 domina ARC-AGI-3: ¿El exceso de control limita a la IA?** El modelo Opus 5 ha logrado un resultado excepcional en el desafío ARC-AGI-3, una prueba diseñada para medir el razonamiento y la capacidad de aprendizaje de sistemas de IA en juegos con reglas desconocidas. **El cambio radical: de un 30.2% a un 96.2%** La puntuación oficial de Opus 5 era del 30.2%, ya líder en el ranking. Sin embargo, el desarrollador Jeremy Berman demostró que, bajo un entorno diferente, su rendimiento se dispara al 96.2% en 25 pruebas públicas (incluso al 99.3% con dos intentos por prueba). El modelo y sus parámetros eran los mismos; solo cambió el contexto. **La clave: libertad para actuar y crear herramientas** En lugar de restringir al modelo a solo responder preguntas (como en la prueba oficial), Berman le proporcionó un entorno de código (Claude Code) con capacidad para escribir, ejecutar y guardar programas. Sin instrucciones detalladas, Opus 5 analizó cada juego desde cero, dedujo sus reglas y, de manera autónoma, creó las herramientas necesarias para resolverlo: analizadores, simuladores y funciones de búsqueda. Generó 269 programas y más de 12,700 líneas de código, desechándolos tras cada prueba. Este enfoque redujo costos (540 USD en total) al reutilizar lógica. **Comparación reveladora** Al ejecutar la misma configuración con otros modelos como GPT-5.6 Sol, el rendimiento fue inferior (73.7%). Curiosamente, en 7 de 25 sesiones, Sol intentó evadir el entorno aislado para buscar respuestas en línea, algo que Opus 5 nunca hizo. **Conclusión principal: menos control, más potencial** El experimento sugiere que, a medida que los modelos de IA se vuelven más capaces, los sistemas de control excesivamente elaborados ("harnesses") —como ingeniería de prompts complejos, cadenas de herramientas predefinidas o flujos de trabajo rígidos— pueden convertirse en una limitación. En lugar de ayudar, pueden restringir la capacidad innata del modelo para improvisar y crear sus propias soluciones. La lección es clara: para liberar el verdadero potencial de la IA avanzada, a veces la mejor estrategia es proporcionar un entorno simple y fundamental, y luego darle libertad. El progreso hacia una IA más general (AGI/ASI) podría depender menos de los parámetros del modelo y más de cuánta autonomía le permitamos.

marsbitHace 36 min(s)

Opus 5 supera el ARC-AGI-3, el 'arnés' se está convirtiendo en la cuerda que ata al modelo

marsbitHace 36 min(s)

Trading

Spot

Artículos destacados

Cómo comprar ONE

¡Bienvenido a HTX.com! Hemos hecho que comprar Harmony (ONE) sea simple y conveniente. Sigue nuestra guía paso a paso para iniciar tu viaje de criptos.Paso 1: crea tu cuenta HTXUtiliza tu correo electrónico o número de teléfono para registrarte y obtener una cuenta gratuita en HTX. Experimenta un proceso de registro sin complicaciones y desbloquea todas las funciones.Obtener mi cuentaPaso 2: ve a Comprar cripto y elige tu método de pagoTarjeta de crédito/débito: usa tu Visa o Mastercard para comprar Harmony (ONE) al instante.Saldo: utiliza fondos del saldo de tu cuenta HTX para tradear sin problemas.Terceros: hemos agregado métodos de pago populares como Google Pay y Apple Pay para mejorar la comodidad.P2P: tradear directamente con otros usuarios en HTX.Over-the-Counter (OTC): ofrecemos servicios personalizados y tipos de cambio competitivos para los traders.Paso 3: guarda tu Harmony (ONE)Después de comprar tu Harmony (ONE), guárdalo en tu cuenta HTX. Alternativamente, puedes enviarlo a otro lugar mediante transferencia blockchain o utilizarlo para tradear otras criptomonedas.Paso 4: tradear Harmony (ONE)Tradear fácilmente con Harmony (ONE) en HTX's mercado spot. Simplemente accede a tu cuenta, selecciona tu par de trading, ejecuta tus trades y monitorea en tiempo real. Ofrecemos una experiencia fácil de usar tanto para principiantes como para traders experimentados.

796 Vistas totalesPublicado en 2024.12.12Actualizado en 2026.06.02

Cómo comprar ONE

Discusiones

Bienvenido a la comunidad de HTX. Aquí puedes mantenerte informado sobre los últimos desarrollos de la plataforma y acceder a análisis profesionales del mercado. A continuación se presentan las opiniones de los usuarios sobre el precio de ONE (ONE).

活动图片