Última hora: Musk presenta Grok 4.5, su modelo más potente, y pone precio de saldo a la máxima inteligencia de Opus

marsbitPublicado a 2026-07-09Actualizado a 2026-07-09

Resumen

¡Última hora! SpaceXAI, la empresa de IA de Elon Musk, acaba de presentar su modelo insignia más potente hasta la fecha: Grok 4.5. Desarrollado en colaboración con Cursor y entrenado en decenas de miles de GPUs GB300, este modelo está específicamente diseñado para codificación y agentes inteligentes. Grok 4.5 demuestra un rendimiento impresionante, rivalizando con los mejores modelos. En SWE Bench Pro logra un 64.7%, superando a Opus 4.7. También destaca en Terminal Bench 2.1 (83.3%) y DeepSWE 1.0 (62%), donde supera a Opus 4.8. Según Musk, su rendimiento es comparable a Opus 4.7, pero significativamente más rápido. La verdadera ventaja competitiva de Grok 4.5 radica en su eficiencia y costo. Su velocidad de inferencia es de 80 TPS, y consume 4.2 veces menos tokens que Opus 4.8 para completar las mismas tareas complejas. Su precio es de $2 por millón de tokens de entrada y $6 por millón de salida, lo que lo posiciona como una opción de alta relación costo-rendimiento en el mercado de modelos de alto nivel. Las pruebas en línea muestran su capacidad para generar rápidamente código funcional, como un simulador 3D del sistema solar o páginas web complejas, aunque algunos señalan áreas de mejora en comparación con modelos como Opus 4.7. Musk ha anunciado que una versión aún más potente llegará el próximo mes, aprovechando datos de problemas de ingeniería del mundo real de sus empresas. Grok 4.5 puede no ser el modelo más fuerte en todos los aspectos, pero su combinación de re...

¡Grok 4.5 por fin está aquí!

Hace apenas un momento, SpaceXAI de Elon Musk lanzó con gran impacto su modelo insignia más potente de la historia: Grok 4.5.

Esta vez, SpaceXAI y Cursor han unido fuerzas.

En decenas de miles de bestias GB300, han "entrenado" a este monstruo de rendimiento, diseñado específicamente para codificación y agentes inteligentes.

El boletín de calificaciones es bastante brillante:

  • SWE Bench Pro: consigue un 64.7%, enfrentándose directamente y superando el 64.3% de Opus 4.7;
  • Terminal Bench 2.1: se dispara hasta el 83.3%;
  • DeepSWE 1.0: se sitúa firmemente en un 62.0%, superando con claridad a Opus 4.8.

Musk afirma directamente: "Grok 4.5 es aproximadamente equivalente a Opus 4.7, pero mucho más rápido".

La combinación de capacidad, velocidad y coste es lo que define su competitividad. En otras palabras, consume una fracción de los tokens que usan los demás para el mismo trabajo.

Grok 4.5 tiene un precio de entrada de $2 por millón de tokens y de salida de $6 por millón de tokens.

En comparación con Opus 4.8, el consumo de tokens se reduce drásticamente en un factor de 4.2.

Decenas de miles de GB300 entrenan un modelo de "nivel Opus"

Grok 4.5 es el primer as en la manga de SpaceXAI tras su salida a bolsa, y también la primera respuesta que presentan junto a Cursor.

Entonces, ¿cómo se entrenó?

La respuesta es: un entrenamiento a hiperescala con decenas de miles de GPUs GB300 de Nvidia. Pero la potencia de cálculo es solo la entrada.

Musk anuncia: la próxima semana Grok 4.5 actualizará su contexto a 1 millón de tokens

Donde SpaceXAI realmente ha puesto el esfuerzo es en los datos.

Filtraron, desduplicaron y calificaron la calidad de un océano de corpus de manera exhaustiva, asegurando que todo el contenido introducido en el modelo fuera profesional y de alta densidad informativa.

Luego, centraron el enfoque del RL (Aprendizaje por Refuerzo) en una métrica que pocos mencionan: la "inteligencia por token" (per-token intelligence).

La incorporación de Cursor es el eslabón más crítico de este ciclo.

La base de Grok 4.5 es V9 (1.5T). Oficialmente, se alimentó con billones de datos de Cursor durante el entrenamiento.

Estos datos registran cómo interactúan los desarrolladores reales con repositorios de código, herramientas y agentes inteligentes.

Esto significa que el modelo no solo aprendió "cómo es el código", sino "cómo las personas y la IA escriben código juntos".

Y su pila de entrenamiento está diseñada para ser altamente asíncrona:

Los agentes pueden ejecutarse durante horas, el modelo sigue aprendiendo mientras trabaja, y el entrenamiento en decenas de miles de GPUs nunca se detiene.

El resultado es que no solo resuelve problemas, sino que puede manejar tareas de ingeniería complejas y de múltiples pasos que duran varias horas.

Iguala a GPT-5.5, se acerca a Opus 4.8

El rendimiento duro de Grok 4.5 bajo este enfoque de entrenamiento resiste cualquier prueba.

Su desempeño en los principales benchmarks de ingeniería puede describirse como "sólido": no es el más fuerte, pero lo suficientemente bueno para entrar en el primer grupo.

En DeepSWE 1.0, logra un 62.0%, superando a Opus 4.8 (55.75%) y siguiendo de cerca a GPT-5.5 (64.31%);

En Terminal Bench 2.1, alcanza el 83.3%, ¡a solo 0.1 puntos de GPT-5.5 (83.4%)!;

En el más exigente SWE Bench Pro, con una tasa de resolución del 64.7%, supera a GPT-5.5 (58.6%) y se acerca a Opus 4.8 (69.2%).

En las pruebas oficiales de la AAAI, Grok 4.5 ocupa el cuarto puesto, solo por detrás de Fable 5, GPT-5.5 y Opus 4.8.

En el benchmark de agentes legales inteligentes Harvey, ocupa el primer puesto.

Hay que admitir que estos resultados son muy competitivos.

Pero también hay que reconocer que el que sigue reinando indiscutiblemente es Claude Fable.

En resumen, Grok 4.5 está prácticamente a la par con GPT-5.5, muy cerca de Opus 4.8, pero aún le queda camino para alcanzar el verdadero techo.

El propio Musk lo dice con realismo: "Nuestra evaluación interna es que Grok 4.5 es aproximadamente equivalente a Opus 4.7, pero mucho más rápido".

El verdadero golpe maestro: rápido y barato

El verdadero impacto de Grok 4.5 está en tres palabras: velocidad, eficiencia y precio.

Su velocidad de inferencia alcanza los 80 TPS (tokens por segundo). Las palabras oficiales son: "más rápido que los modelos flash".

Con una sola frase, escribió un simulador 3D del sistema solar en Three.js:

Soporta aceleración temporal, los movimientos orbitales de los ocho planetas son realistas, e incluso el panel HUD está bastante bien hecho.

En cuanto a eficiencia, en las tareas de SWE Bench Pro, Grok 4.5 emite un promedio de solo 15,954 tokens para resolver el problema.

Mientras que Opus 4.8 necesita emitir 67,020 tokens para el mismo trabajo.

Un factor de 4.2: Grok 4.5 usa menos de una cuarta parte de los tokens de su competidor para resolver el mismo problema de ingeniería.

En precio: 2 dólares por millón de tokens de entrada, 6 dólares por millón de tokens de salida.

Además, hay una versión avanzada más rápida, con un precio de 4 dólares por entrada y 18 dólares por salida.

Comparado con los principales modelos que a menudo empiezan en más de diez dólares, este precio es casi de saldo.

Estos tres números juntos llevan a una conclusión:

En términos de "cuánta inteligencia se puede comprar por unidad de tiempo y coste", Grok 4.5 es actualmente el "rey de la relación calidad-precio".

Pruebas en la red: el rendimiento real de Grok 4.5

Además, los comentarios de las pruebas realizadas por numerosos usuarios en la red nos permiten vislumbrar parte de la capacidad real de Grok 4.5.

Con una frase, genera directamente un "Minecraft".

En un solo archivo HTML, Grok 4.5 puede crear fácilmente una página SaaS completa y de alta gama.

Grok 4.5 demuestra su habilidad, completando todo un conjunto de diseños 2D+3D en menos de un minuto dentro de la aplicación.

El experto en juegos de IA, Danny Limanseta, usó Grok 4.5 para generar un juego completo con diversas funcionalidades.

Sin embargo, también hay desarrolladores que dicen que Grok 4.5 no está en absoluto al mismo nivel que Opus 4.7, y que en la prueba de la lámpara de lava los resultados fueron malos.

No es el más fuerte, preparándose para volcar la mesa el próximo mes

Hoy, Musk ha vuelto a sembrar una bomba:

Grok entiende profundamente la ingeniería.

La versión del próximo mes será otro salto cualitativo, porque estamos cerrando el círculo de resolver problemas de ingeniería reales en Tesla, SpaceX, Neuralink y Boring Company.

El próximo mes, otro salto. Y, según se rumorea, una versión más grande de 2 billones de parámetros ya está en camino.

Los benchmarks son fuegos artificiales para profanos; la eficiencia y el coste son las verdaderas armas para arrastrar a los competidores a una guerra de desgaste.

Cuando la inteligencia de los modelos comienza a facturarse como la electricidad por kilovatio-hora, la clave del éxito es quién puede hacer que la inteligencia sea rápida, barata y omnipresente.

Esta vez, Musk no jugó la carta más fuerte, pero volcó la mesa de juego.

Referencias:

https://x.ai/news/grok-4-5

https://cursor.com/blog/grok-4-5

Este artículo proviene del WeChat público "New Zhiyuan", autor: ASI Revelations, editor: Peach

Preguntas relacionadas

Q¿Qué logró alcanzar Grok 4.5 en la prueba SWE Bench Pro y cómo se compara con Opus 4.7?

AGrok 4.5 logró un 64.7% en la prueba SWE Bench Pro, superando ligeramente el 64.3% de Opus 4.7.

QSegún el artículo, ¿cuál es el precio por millón de tokens de entrada y salida para Grok 4.5?

AEl precio por millón de tokens es de $2 para la entrada y $6 para la salida.

Q¿Con qué empresa colaboró SpaceXAI para entrenar a Grok 4.5 y qué tipo de datos aportó esta colaboración?

ASpaceXAI colaboró con Cursor, que aportó billones de datos que registran cómo los desarrolladores interactúan con repositorios de código, herramientas y agentes inteligentes.

QAdemás del rendimiento, ¿cuáles son las otras dos ventajas clave de Grok 4.5 mencionadas en el artículo?

ALas otras dos ventajas clave son su velocidad (hasta 80 TPS) y su eficiencia en costos, utilizando muchos menos tokens que modelos competidores para tareas similares.

Q¿Qué anunció Elon Musk que se espera para la próxima versión de Grok el próximo mes?

AElon Musk anunció que la versión del próximo mes tendrá una mejora significativa (un salto escalonado), ya que integrará la resolución de problemas de ingeniería reales de Tesla, SpaceX, Neuralink y Boring Company.

Lecturas Relacionadas

Los retiros de Bitcoin continúan: 8 años de almacenamiento en una cartera fría Coldcard terminaron en cero

Retirada de bitcoin continúa: 8 años en cartera fría Coldcard terminan en cero La cartera hardware Coldcard ha sido vulnerada, provocando una nueva oleada de retiradas de fondos de dispositivos afectados. Galaxy Research informa que el volumen total robado asciende a 1.367,05 BTC (unos 88,6 millones de dólares) desde 4.585 direcciones, superando ampliamente los 594,5 BTC reportados inicialmente el 30 de julio de 2026. La mayor parte de lo robado permanece inactiva en las direcciones de los atacantes. El problema no reside en el firmware, que ya fue actualizado por Coinkite, sino en las frases semilla (seed phrases) generadas desde marzo de 2021 debido a un error de programación. Estas frases son fácilmente descifrables, y actualizar el firmware no las cambia. Solo transferir los fondos a una nueva dirección con una nueva frase semilla elimina la vulnerabilidad. El fallo se originó al integrar la biblioteca libNgU, lo que hizo que los dispositivos dejaran de usar el generador de números aleatorios por hardware STM32 y pasaran a usar el generador software Yasmarang, inicializado con datos públicamente accesibles como el número de serie del chip. Afecta a frases semilla creadas en dispositivos Mk2/Mk3 (firmware 4.0.1–4.1.9 y hasta 5.0.3), Mk4/Mk5 (hasta v5.6.0) y Q (hasta v1.5.0Q). Se excluyen aquellas creadas con al menos 50 lanzamientos de dados independientes o una passphrase BIP-39 fuerte y única. Los usuarios deben generar una nueva frase semilla en firmware corregido y transferir sus activos. Un caso ilustrativo es el de un inversor de 39 años que perdió 2 BTC (unos 130.000 dólares) en minutos, ahorrados durante ocho años mediante trabajo físico como protección contra la hiperinflación en su país, con el objetivo de una jubilación anticipada a los 50 años. Su estrategia conservadora de "comprar y mantener en frío" se vio truncada, dejándolo devastado y decidido a abandonar las criptomonedas. Este incidente recuerda vulnerabilidades históricas por generadores de números aleatorios débiles, como la de la biblioteca BitcoinJS (2011-2015), que causó grandes pérdidas. Subraya que el almacenamiento offline no garantiza automáticamente seguridad criptográfica, especialmente cuando la entropía se ve comprometida dentro del propio dispositivo "cerrado".

cryptonews.ruHace 3 hora(s)

Los retiros de Bitcoin continúan: 8 años de almacenamiento en una cartera fría Coldcard terminaron en cero

cryptonews.ruHace 3 hora(s)

Trading

Spot
活动图片