Pruebas reales de dos nuevos modelos Claude se filtran, el razonamiento espacial es divino, y consumen una potencia de cálculo brutal

marsbitPublicado a 2026-08-25Actualizado a 2026-08-25

Resumen

Claude, la compañía de IA, ha filtrado dos nuevos modelos internos en fase de prueba avanzada, apodados "Marshmallow" (Algodón de Azúcar) y "Melon" (Melón). Las primeras evaluaciones muestran capacidades revolucionarias en razonamiento espacial 3D y diseño arquitectónico, generando diseños complejos y precisos de una sola vez (one-shot), lo que supera una limitación histórica de los LLMs. Sin embargo, estos modelos consumen una cantidad masiva de "tokens de pensamiento" (thinking tokens) durante la inferencia, agotando frecuentemente los límites del sistema, lo que indica un gran avance en razonamiento profundo pero a un alto coste computacional. Su aparición, poco después del lanzamiento considerado decepcionante de Opus 5, sugiere que Anthropic podría estar acelerando su desarrollo para responder a la competencia, ya sea como una versión mejorada de Opus (Opus 5.1) o como nuevas iteraciones de sus líneas Sonnet o Haiku.

¡Las pruebas reales de los dos nuevos modelos de Claude – 'Marshmallow' y 'Melon' – filtrados ayer ya han aparecido hoy!

Tras realizar pruebas, algunos han descubierto que el rendimiento de estos dos nuevos modelos en aprendizaje por refuerzo 3D y distribución espacial arquitectónica es increíblemente potente.

Además, su consumo de potencia de cálculo también es extremadamente elevado.

Antes de dar una respuesta, consumen una cantidad masiva de "tokens de pensamiento" (Thinking Tokens) para realizar un razonamiento lógico profundo, ¡incluso acercándose repetidamente al límite máximo de uso del sistema!

A juzgar por estos modelos, Claude está evolucionando hacia la próxima gran bestia de la IA, con capacidad de "pensamiento lento" y razonamiento físico-espacial profundo.

Resuelven aprendizaje por refuerzo 3D y distribución arquitectónica de un solo golpe (One-Shot)

Tras realizar pruebas, alguien dio esta evaluación: Anthropic realmente está avanzando a toda velocidad en el aprendizaje por refuerzo 3D.

La distribución espacial de los edificios es simplemente increíblemente buena, ¡y todo esto se genera de una sola vez (One-Shot)!

Hay que recordar que, para los LLM, la imaginación espacial siempre ha sido un punto débil.

Hacer que una IA comprenda la relación de coordenadas físicas entre mesas y sillas en una habitación 3D, las leyes de la gravedad, o planificar la distribución de un complejo arquitectónico con circulaciones complejas y estructuras de carga, es extremadamente difícil.

Pero esta vez, parece que 'Marshmallow' y 'Melon' de Claude han cruzado este abismo.

Son capaces de comprender y generar directamente coordenadas 3D complejas y relaciones espaciales.

Además, en las pruebas se descubrió que su distribución arquitectónica es extremadamente buena, lo que indica que los nuevos modelos también tienen un rendimiento potente al procesar restricciones topológicas, geométricas y físicas.

Y lo hacen con una salida One-Shot, sin necesidad de que los humanos ajusten repetidamente el prompt para corregir errores. Después de un profundo pensamiento interno, el modelo puede generar datos de escenas 3D perfectos de una sola vez.

Esto oculta un enorme valor comercial e industrial.

Imagina que en el futuro, los desarrolladores de videojuegos solo necesitarán describir en lenguaje natural: "Ayúdame a generar una fortaleza de estilo medieval, con tres torres de defensa y un pasadizo secreto subterráneo", y Claude podrá generar directamente el código del modelo 3D perfecto o los parámetros de distribución.

Los arquitectos podrán hacer que la IA genere docenas de esquemas de distribución preliminares que cumplan con la estática estructural, basándose en el terreno y las condiciones de iluminación. La construcción de metaversos, gemelos digitales industriales, entornos de simulación para conducción autónoma...

¡Todo esto será completamente transformado por esta potente capacidad de generación 3D!

El doble golpe de Marshmallow y Melon

Ayer, todo Internet se inundó con 'Marshmallow' y 'Melon'.

Los códigos internos de los dos modelos filtrados son respectivamente claude-marshmallow-eap (Marshmallow) y claude-melon-eap (Melon).

Esta regla de nomenclatura "comida + EAP" continúa la tradición de claude-horchata-eap (una bebida mexicana), que probaron brevemente en julio de este año.

¿De dónde han salido exactamente estos dos modelos?

Según datos interceptados por desarrolladores de los registros de tráfico de la API, durante el período de 00:45-00:57Z del 21 de agosto, ¡la ID de claude-marshmallow-ht-eap fue llamada en alta frecuencia 57 veces en el tráfico de la API!

Posteriormente, apareció conspicuamente en la lista de modelos de Claude Code como "Custom model", con una sorprendente ventana de contexto ultra larga de 1 millón de tokens.

Aunque actualmente estos dos modelos aún no tienen un endpoint de API oficial y parecen estar restringidos al uso de evaluadores del equipo rojo o personal interno clave, los primeros comentarios dispersos de las pruebas ya son lo suficientemente impactantes.

Se considera que la capacidad integral de 'Marshmallow' es ligeramente superior a la de 'Melon'.

En el diálogo cotidiano y la interacción lógica, la experiencia con 'Marshmallow' es incluso mejor que la del Opus 5 actual, y la conversación parece más natural y agradable.

Aunque su rendimiento actual parece estar aún por debajo del nivel superior "Fable" de Anthropic, ¿son acaso el legendario Opus 5.1? ¿Sonnet 5.1? ¿O una nueva iteración de Haiku?

Todavía no hay una conclusión definitiva.

Devoradores de potencia de cálculo: los locos "tokens de pensamiento"

Además, varios evaluadores han descubierto un fenómeno extremadamente anómalo: ¡al usar estos dos nuevos modelos, el consumo de potencia de cálculo alcanza un nivel increíblemente frenético!

Un evaluador exclamó en un tuit: "Noté algo en común en estos dos modelos: usan una cantidad masiva de tokens de pensamiento, ¡hasta el punto de que durante mis pruebas, activé directamente el límite superior de varias veces!"

¿Qué son los "tokens de pensamiento"? ¿Por qué son tan importantes?

En las interacciones pasadas con modelos grandes, la IA solía ser como un respondedor "rápido y directo", generando respuestas palabra por palabra al instante según la distribución de probabilidades.

La nueva generación de modelos de Claude ha cambiado completamente esta lógica. Antes de dar la respuesta final, el modelo genera una gran cantidad de tokens "invisibles" en segundo plano para realizar una autocontemplación extremadamente profunda, construir cadenas de pensamiento y realizar pruebas y errores lógicos.

Esta inyección de potencia de cálculo "sin importar el costo" libera una señal extremadamente fuerte: ¡Anthropic está abordando en secreto el cuello de botella del razonamiento profundo de la IA!

Esto también confirma las especulaciones previas dentro de la industria: la competencia entre modelos grandes está pasando de "la acumulación de potencia de cálculo en la fase de entrenamiento" a "el consumo de potencia de cálculo en la fase de inferencia".

Cuando Claude comienza a "pensar" frenéticamente hasta tocar el límite superior, la calidad de las respuestas que genere formará una ventaja abrumadora sobre los modelos tradicionales.

¿Sospecha de respuesta de emergencia? La "batalla de la venganza" de Opus 5

La repentina filtración de estos dos modelos misteriosos también tiene un momento delicado.

Apenas hace menos de un mes, el 24 de julio de 2026, Anthropic acaba de lanzar su esperado modelo insignia, Opus 5.

Antes de eso, el Sonnet 5 lanzado el 30 de junio fue muy bien recibido.

Sin embargo, Opus 5 sufrió un fracaso.

Un desarrollador se burló sin piedad en X: "Las críticas negativas sobre Opus 5 son tan graves que Anthropic tuvo que lanzar inmediatamente dos nuevos modelos para intentar reemplazarlo... Me muero de risa."

De hecho, Opus 5 parece no haber cumplido con las expectativas de los usuarios de una "mejora intergeneracional". Para Anthropic, que está ansiosa por salir a bolsa, esto es sin duda un gran golpe.

Por lo tanto, la exposición de 'Marshmallow' y 'Melon' en este momento crítico ha desatado infinitas especulaciones externas.

Conjetura uno: El contraataque final de Opus 5.1.

Muchos creen que estos dos modelos, estrechamente asociados con Opus 5.1, son precisamente la "versión potenciada" de Anthropic, reelaborada urgentemente para abordar los defectos de Opus 5.

Al introducir un potente mecanismo de "tokens de pensamiento", elevan forzosamente el techo lógico del modelo.

Conjetura dos: La incursión de la nueva generación de Sonnet / Haiku.

Algunos evaluadores también creen que, considerando su velocidad y relación calidad-precio sorprendentes, podrían ser versiones actualizadas de Sonnet o Haiku, después de todo no se les ha otorgado el título superior de "Fable".

Pero sea cual sea el caso, Anthropic obviamente ya no puede quedarse quieto.

Están acelerando frenéticamente la velocidad de iteración, incluso hasta el punto de liberar directamente para pruebas modelos de vanguardia que consumen una potencia de cálculo extrema.

Los desarrolladores ya no pueden contener su emoción: "¡Las próximas semanas y meses se volverán extremadamente interesantes!"

¿Podrán Marshmallow y Melon lavar la deshonra previa de Opus 5 y hacer que Anthropic gane otra ronda?

Referencias:

https://x.com/Lentils80/status/2091704307863142812?s=20

https://x.com/NFT_Chen/status/2091764673767198730?s=20

Este artículo proviene del WeChat público "新智元", autor: ASI启示录; editor: Aeneas

Preguntas relacionadas

Q¿Cuáles son los nombres en clave de los dos nuevos modelos de Claude mencionados en el artículo y en qué destacan?

ALos nombres en clave son 'claude-marshmallow-eap' (Algodón de Azúcar) y 'claude-melon-eap' (Melón). Destacan por su extraordinaria capacidad de razonamiento espacial y 3D, logrando generar diseños de diseño arquitectónico y escenarios 3D complejos de manera one-shot, así como por consumir una gran cantidad de 'tokens de pensamiento' durante el proceso de razonamiento profundo.

QSegún el artículo, ¿qué significa el alto consumo de 'tokens de pensamiento' en los nuevos modelos?

AEl alto consumo de 'tokens de pensamiento' significa que los nuevos modelos realizan un proceso interno extenso y profundo de autorreflexión, razonamiento en cadena y prueba de lógica antes de generar una respuesta final. Esto indica que Anthropic está enfocándose en superar los cuellos de botella del razonamiento profundo en IA, priorizando la calidad de la respuesta sobre la eficiencia computacional inmediata.

Q¿Qué ventajas prácticas podrían tener estos modelos avanzados en razonamiento espacial 3D para industrias como el diseño de videojuegos o la arquitectura?

APodrían revolucionar industrias como el diseño de videojuegos o la arquitectura al permitir generar código para modelos 3D o parámetros de diseño complejos simplemente con descripciones en lenguaje natural. Por ejemplo, un desarrollador podría pedir una fortaleza de estilo medieval con torres y túneles secretos, y el modelo generaría el diseño perfecto de una vez, ahorrando tiempo y recursos en iteraciones.

Q¿Por qué sugiere el artículo que la filtración de estos modelos podría estar relacionada con el desempeño de Opus 5?

AEl artículo sugiere que la filtración de estos modelos, poco después del lanzamiento considerado decepcionante de Opus 5, podría ser una respuesta de Anthropic para contrarrestar las críticas. Se especula que podrían ser versiones reforzadas (como un Opus 5.1) o nuevas iteraciones de otras líneas (Sonnet/Haiku), mostrando que la compañía está acelerando su desarrollo para recuperar terreno en la competencia.

Q¿Cómo se descubrieron inicialmente los modelos 'Algodón de Azúcar' y 'Melón' según la información del artículo?

ASegún el artículo, los modelos fueron descubiertos inicialmente a través del análisis del tráfico de la API. Los desarrolladores detectaron que el ID 'claude-marshmallow-ht-eap' fue llamado 57 veces en un corto período el 21 de agosto. Posteriormente, apareció en la lista de modelos de Claude Code como un 'modelo personalizado' con un contexto de ventana de hasta 1 millón de tokens.

Lecturas Relacionadas

Prueba de demanda: las ballenas de Bitcoin obtuvieron ganancias récord de 1200 millones de dólares, mientras que los poseedores de Ethereum volvieron a la rentabilidad

Los grandes tenedores de bitcóin, conocidos como «ballenas», obtuvieron más de 1.200 millones de dólares en ganancias en solo tres días tras la recuperación del precio de la principal criptomoneda, según CryptoQuant. Este evento, que alcanzó un pico de 614 millones de dólares el 20 de agosto, es el mayor registro de toma de ganancias para este grupo. Los analistas señalan que esto ocurrió después de que el bitcóin superara su precio de coste promedio de alrededor de 68.900 dólares, cotizando cerca de 77.700 dólares el 23 de agosto. La situación se considera una prueba clave para la demanda: si el activo se mantiene por encima de ese nivel y las ventas se normalizan, podría indicar una demanda sólida; de lo contrario, el rally podría convertirse en una simple salida al punto de equilibrio. En cuanto a Ethereum, los grandes inversores también han vuelto a tener ganancias no realizadas, aunque los niveles actuales son relativamente bajos y no ejercerían una presión significativa sobre el precio. El ratio de ganancias/pérdidas no realizadas para diferentes grupos de tenedores varía entre 0,075 y 0,38. Los analistas ven esto como una señal positiva, dado que en junio estos inversores estaban en pérdida y el activo ha subido más de un 65% desde entonces.

cryptonews.ruHace 2 min(s)

Prueba de demanda: las ballenas de Bitcoin obtuvieron ganancias récord de 1200 millones de dólares, mientras que los poseedores de Ethereum volvieron a la rentabilidad

cryptonews.ruHace 2 min(s)

Kinetiq anuncia la red de capa 2 Elysium para Hyperliquid

El 24 de agosto, el protocolo de staking líquido Kinetiq anunció Elysium, una nueva red de capa 2 (L2) para el ecosistema Hyperliquid. Su objetivo es aumentar el rendimiento de HyperEVM y simplificar el lanzamiento de mercados spot, tokens y aplicaciones DeFi. Elysium utilizará $HYPE para pagar las tarifas de gas y se integrará directamente con el motor de trading HyperCore, permitiendo a las aplicaciones acceder a su liquidez y datos del libro de órdenes. Las especificaciones técnicas, la lista de socios y la fecha exacta de lanzamiento se revelarán más adelante. La red aborda las limitaciones de HyperEVM, como su baja capacidad de procesamiento y el aumento de tarifas durante periodos de alta demanda, prometiendo una velocidad de transacciones significativamente mayor desde el inicio. Está diseñada para aplicaciones que requieren actualizaciones frecuentes de estado, como el trading spot de alta frecuencia, AMMs y otros servicios DeFi, proporcionando también un acceso más profundo a los datos de HyperCore. Elysium también simplificará el proceso de lanzamiento de nuevos activos dentro de Hyperliquid, unificando los pasos para proporcionar liquidez inicial vía AMM, listar en el mercado spot de HyperCore y posteriormente lanzar contratos perpétutos a través del mecanismo HIP-3. En cuanto a su modelo económico, el 50% de los ingresos del secuenciador se destinará a recomprar y quemar tokens $KNTQ, el 25% se asignará a los desarrolladores de aplicaciones y el 25% restante irá a la tesorería de Kinetiq. Esta red marca la expansión del negocio del protocolo más allá del staking líquido de $HYPE, cuyo producto principal sigue siendo kHYPE.

cryptonews.ruHace 4 min(s)

Kinetiq anuncia la red de capa 2 Elysium para Hyperliquid

cryptonews.ruHace 4 min(s)

Trading

Spot
活动图片