¡Las pruebas reales de los dos nuevos modelos de Claude – 'Marshmallow' y 'Melon' – filtrados ayer ya han aparecido hoy!
Tras realizar pruebas, algunos han descubierto que el rendimiento de estos dos nuevos modelos en aprendizaje por refuerzo 3D y distribución espacial arquitectónica es increíblemente potente.

Además, su consumo de potencia de cálculo también es extremadamente elevado.
Antes de dar una respuesta, consumen una cantidad masiva de "tokens de pensamiento" (Thinking Tokens) para realizar un razonamiento lógico profundo, ¡incluso acercándose repetidamente al límite máximo de uso del sistema!
A juzgar por estos modelos, Claude está evolucionando hacia la próxima gran bestia de la IA, con capacidad de "pensamiento lento" y razonamiento físico-espacial profundo.

Resuelven aprendizaje por refuerzo 3D y distribución arquitectónica de un solo golpe (One-Shot)
Tras realizar pruebas, alguien dio esta evaluación: Anthropic realmente está avanzando a toda velocidad en el aprendizaje por refuerzo 3D.
La distribución espacial de los edificios es simplemente increíblemente buena, ¡y todo esto se genera de una sola vez (One-Shot)!


Hay que recordar que, para los LLM, la imaginación espacial siempre ha sido un punto débil.
Hacer que una IA comprenda la relación de coordenadas físicas entre mesas y sillas en una habitación 3D, las leyes de la gravedad, o planificar la distribución de un complejo arquitectónico con circulaciones complejas y estructuras de carga, es extremadamente difícil.
Pero esta vez, parece que 'Marshmallow' y 'Melon' de Claude han cruzado este abismo.
Son capaces de comprender y generar directamente coordenadas 3D complejas y relaciones espaciales.
Además, en las pruebas se descubrió que su distribución arquitectónica es extremadamente buena, lo que indica que los nuevos modelos también tienen un rendimiento potente al procesar restricciones topológicas, geométricas y físicas.
Y lo hacen con una salida One-Shot, sin necesidad de que los humanos ajusten repetidamente el prompt para corregir errores. Después de un profundo pensamiento interno, el modelo puede generar datos de escenas 3D perfectos de una sola vez.
Esto oculta un enorme valor comercial e industrial.
Imagina que en el futuro, los desarrolladores de videojuegos solo necesitarán describir en lenguaje natural: "Ayúdame a generar una fortaleza de estilo medieval, con tres torres de defensa y un pasadizo secreto subterráneo", y Claude podrá generar directamente el código del modelo 3D perfecto o los parámetros de distribución.
Los arquitectos podrán hacer que la IA genere docenas de esquemas de distribución preliminares que cumplan con la estática estructural, basándose en el terreno y las condiciones de iluminación. La construcción de metaversos, gemelos digitales industriales, entornos de simulación para conducción autónoma...
¡Todo esto será completamente transformado por esta potente capacidad de generación 3D!
El doble golpe de Marshmallow y Melon
Ayer, todo Internet se inundó con 'Marshmallow' y 'Melon'.
Los códigos internos de los dos modelos filtrados son respectivamente claude-marshmallow-eap (Marshmallow) y claude-melon-eap (Melon).

Esta regla de nomenclatura "comida + EAP" continúa la tradición de claude-horchata-eap (una bebida mexicana), que probaron brevemente en julio de este año.
¿De dónde han salido exactamente estos dos modelos?
Según datos interceptados por desarrolladores de los registros de tráfico de la API, durante el período de 00:45-00:57Z del 21 de agosto, ¡la ID de claude-marshmallow-ht-eap fue llamada en alta frecuencia 57 veces en el tráfico de la API!
Posteriormente, apareció conspicuamente en la lista de modelos de Claude Code como "Custom model", con una sorprendente ventana de contexto ultra larga de 1 millón de tokens.
Aunque actualmente estos dos modelos aún no tienen un endpoint de API oficial y parecen estar restringidos al uso de evaluadores del equipo rojo o personal interno clave, los primeros comentarios dispersos de las pruebas ya son lo suficientemente impactantes.



Se considera que la capacidad integral de 'Marshmallow' es ligeramente superior a la de 'Melon'.
En el diálogo cotidiano y la interacción lógica, la experiencia con 'Marshmallow' es incluso mejor que la del Opus 5 actual, y la conversación parece más natural y agradable.
Aunque su rendimiento actual parece estar aún por debajo del nivel superior "Fable" de Anthropic, ¿son acaso el legendario Opus 5.1? ¿Sonnet 5.1? ¿O una nueva iteración de Haiku?
Todavía no hay una conclusión definitiva.

Devoradores de potencia de cálculo: los locos "tokens de pensamiento"
Además, varios evaluadores han descubierto un fenómeno extremadamente anómalo: ¡al usar estos dos nuevos modelos, el consumo de potencia de cálculo alcanza un nivel increíblemente frenético!
Un evaluador exclamó en un tuit: "Noté algo en común en estos dos modelos: usan una cantidad masiva de tokens de pensamiento, ¡hasta el punto de que durante mis pruebas, activé directamente el límite superior de varias veces!"
¿Qué son los "tokens de pensamiento"? ¿Por qué son tan importantes?
En las interacciones pasadas con modelos grandes, la IA solía ser como un respondedor "rápido y directo", generando respuestas palabra por palabra al instante según la distribución de probabilidades.
La nueva generación de modelos de Claude ha cambiado completamente esta lógica. Antes de dar la respuesta final, el modelo genera una gran cantidad de tokens "invisibles" en segundo plano para realizar una autocontemplación extremadamente profunda, construir cadenas de pensamiento y realizar pruebas y errores lógicos.

Esta inyección de potencia de cálculo "sin importar el costo" libera una señal extremadamente fuerte: ¡Anthropic está abordando en secreto el cuello de botella del razonamiento profundo de la IA!
Esto también confirma las especulaciones previas dentro de la industria: la competencia entre modelos grandes está pasando de "la acumulación de potencia de cálculo en la fase de entrenamiento" a "el consumo de potencia de cálculo en la fase de inferencia".
Cuando Claude comienza a "pensar" frenéticamente hasta tocar el límite superior, la calidad de las respuestas que genere formará una ventaja abrumadora sobre los modelos tradicionales.
¿Sospecha de respuesta de emergencia? La "batalla de la venganza" de Opus 5
La repentina filtración de estos dos modelos misteriosos también tiene un momento delicado.
Apenas hace menos de un mes, el 24 de julio de 2026, Anthropic acaba de lanzar su esperado modelo insignia, Opus 5.
Antes de eso, el Sonnet 5 lanzado el 30 de junio fue muy bien recibido.
Sin embargo, Opus 5 sufrió un fracaso.
Un desarrollador se burló sin piedad en X: "Las críticas negativas sobre Opus 5 son tan graves que Anthropic tuvo que lanzar inmediatamente dos nuevos modelos para intentar reemplazarlo... Me muero de risa."
De hecho, Opus 5 parece no haber cumplido con las expectativas de los usuarios de una "mejora intergeneracional". Para Anthropic, que está ansiosa por salir a bolsa, esto es sin duda un gran golpe.
Por lo tanto, la exposición de 'Marshmallow' y 'Melon' en este momento crítico ha desatado infinitas especulaciones externas.
Conjetura uno: El contraataque final de Opus 5.1.
Muchos creen que estos dos modelos, estrechamente asociados con Opus 5.1, son precisamente la "versión potenciada" de Anthropic, reelaborada urgentemente para abordar los defectos de Opus 5.
Al introducir un potente mecanismo de "tokens de pensamiento", elevan forzosamente el techo lógico del modelo.
Conjetura dos: La incursión de la nueva generación de Sonnet / Haiku.
Algunos evaluadores también creen que, considerando su velocidad y relación calidad-precio sorprendentes, podrían ser versiones actualizadas de Sonnet o Haiku, después de todo no se les ha otorgado el título superior de "Fable".

Pero sea cual sea el caso, Anthropic obviamente ya no puede quedarse quieto.
Están acelerando frenéticamente la velocidad de iteración, incluso hasta el punto de liberar directamente para pruebas modelos de vanguardia que consumen una potencia de cálculo extrema.
Los desarrolladores ya no pueden contener su emoción: "¡Las próximas semanas y meses se volverán extremadamente interesantes!"
¿Podrán Marshmallow y Melon lavar la deshonra previa de Opus 5 y hacer que Anthropic gane otra ronda?
Referencias:
https://x.com/Lentils80/status/2091704307863142812?s=20
https://x.com/NFT_Chen/status/2091764673767198730?s=20
Este artículo proviene del WeChat público "新智元", autor: ASI启示录; editor: Aeneas





