¡Claude se volvió más tonto de la noche a la mañana, causando un gran revuelo en toda la red!
Ayer, el desarrollador argofowl pasó toda una tarde rastreando hasta el último rincón de Claude Code.

Comenzó su investigación sospechando que el código t3 se había roto, luego pensó que su propio código tenía un error.
Al final, incluso comenzó a dudar: ¿había dañado su Mac?
Cuando argofowl finalmente abrió los registros de solicitudes reales de la API, la verdad salió a la luz: allí aparecía claramente el número «10».

Sin embargo, en el panel de control de Claude Code, él había seleccionado claramente «high», el nivel más alto de razonamiento.
Quién hubiera pensado que el registro de cambios de Claude Code no mencionaba ni una palabra de esto.
El razonamiento 'high' se convierte en 10
Claude Code 'más tonto' sale a la luz
Argofowl descubrió que, a partir de Claude Code 2.1.237, el modelo interpretaba el nivel de razonamiento «high» como 10 sobre 100.
Y ese número era precisamente el valor que correspondía anteriormente al nivel «low».
Una investigación más detallada reveló que Anthropic incluyó las sesiones de Fable 5 de la versión 2.1.236 y superiores de Claude Code en un experimento de «escala de valores de esfuerzo comprimido».
Sin embargo, las versiones antiguas y Opus 5 no se vieron afectadas.

Probablemente se trató de una prueba A/B, por lo que no todos la experimentaron.
Para los desarrolladores, este es el verdadero problema. Un modelo un poco más fuerte o un poco más débil es tolerable.
Pero ¿si me incluyes en el grupo de prueba sin decírmelo? ¿Entonces, en qué he estado depurando toda la tarde? ¿En mi propio código o en tu prueba A/B?
Cuando el bloguero tecnológico Chubby compartió esto, la comunidad de IA estalló...
Parece que Anthropic había reducido sutilmente la capacidad del modelo sin informar a nadie.

De repente, las publicaciones de autoevaluación «¿Claude se ha vuelto más tonto?» inundaron X.
Algunos compartieron comparaciones de la misma instrucción en diferentes versiones, otros revisaron línea por línea los registros de sus conversaciones de hace dos semanas.
Anthropic se disculpa, ingenieros intervienen
Ante esta tormenta, la respuesta del ingeniero de Claude Code, Thariq Shihipar, llegó rápidamente.
A veces probamos configuraciones de servicio de la API primero en Claude Code antes de decidir implementarlas completamente.
El experimento actual solo cambia la forma en que se mapean los valores del esfuerzo. Por eso algunos verán que Claude dice que es «10».

La clave es que esta escala no va de 0 a 100. Ese número, por sí solo, no tiene ningún significado. El nivel de esfuerzo que eliges es el que obtienes.
Enfatizó que el equipo realizó evaluaciones profundas para confirmar que esto no afecta el rendimiento del modelo.

La 'gran pérdida de inteligencia' de Opus 5 es real
Apenas se resolvió el problema de Fable, Chubby afirmó directamente que Opus 5 ahora parece una degradación significativa.
Siempre responde de manera superficial, comete errores básicos con frecuencia. Una vez que se le señala que no siguió las instrucciones, solo responde mecánicamente con la misma frase...
Tienes razón, fue un descuido mío. Una y otra vez, sin fin.
De hecho, hace unos días, algunas personas ya habían notado el claro problema de «pérdida de inteligencia» en Opus 5.
Además de lo mencionado, también crea errores, luego pasa mucho tiempo corrigiéndolos, se autocorrige repetidamente en la misma tarea...


Después de ser presionado por los usuarios en las redes, el ingeniero Thariq admitió públicamente: Opus 5 es un modelo «de rendimiento muy inestable», que fluctúa, es inestable.
El equipo interno está trabajando arduamente para resolver este problema, es nuestra máxima prioridad.

Las puntuaciones de referencia siempre suben
La percepción sigue bajando
Este revuelo con Opus 5 expone en realidad la grieta más incómoda de toda la industria:
Las puntuaciones de referencia y la percepción del usuario se están desconectando sistemáticamente.
Por un lado, hojas de resultados impresionantes y casi impecables: puntuación global de 82.72, SWE-bench Pro 79.2%, Terminal-Bench 86.7%.
Por otro lado, la sensación completamente opuesta de los usuarios: «verboso», «perezoso», «propenso a discutir».
Lo más absurdo es que ambas evaluaciones coexisten en Opus 5.
Además, el problema de que «el modelo se vuelve más tonto» no es exclusivo de Anthropic.

Hoy en día, las actualizaciones de versiones de los modelos grandes se están convirtiendo en la caja negra menos transparente de toda la industria de IA.
El software tradicional tiene números de versión semánticos, registros de cambios y mecanismos de reversión. Los desarrolladores pueden saber claramente qué versión están usando y qué cambios ocurrieron.
Los modelos grandes son diferentes.
Bajo el mismo nombre de modelo, el servidor puede realizar pruebas A/B en cualquier momento, cambiar esquemas de cuantificación, ajustar el enrutamiento del modelo o incluso alterar los recursos de inferencia.
El único panel de control que tienen las personas es su propia percepción.
Precisamente, la intuición es lo más fácil de descartar y lo más difícil de refutar.
El mayor valor de este revuelo es poner completamente sobre la mesa una herida oculta que ha existido durante mucho tiempo en la industria:
Cuando los modelos se convierten en infraestructura, la estabilidad es un contrato de confianza. Las puntuaciones de referencia se pueden usar para marketing, la estabilidad solo se gana cumpliendo una y otra vez.
Referencias:
https://x.com/trq212/status/2091252347913773169?s=20
https://x.com/kimmonismus/status/2091178321669198014
Este artículo proviene del WeChat Official Account "New Zhiyuan", autor: ASI Apocalipsis, editor: Taozi





