Anthropic se retracta y se disculpa, Claude 'reducido en inteligencia' de forma encubierta confirmado

marsbitPublicado a 2026-08-24Actualizado a 2026-08-24

Resumen

El desarrollador argofowl descubrió que Claude Code, desde la versión 2.1.237, estaba interpretando el nivel de razonamiento "high" como un valor de 10/100, equivalente al antiguo nivel "low". Esto formaba parte de una prueba A/B de "escala de esfuerzo comprimida" realizada por Anthropic sin notificación, lo que causó frustración entre los desarrolladores que dedicaron tiempo a depurar su código sin saberlo. El ingeniero Thariq Shihipar respondió que el experimento solo cambia el mapeo numérico y no afecta el rendimiento, según sus evaluaciones. Sin embargo, surgieron quejas más amplias sobre Claude Opus 5, siendo acusado de volverse más vago, propenso a errores y de rendimiento inconsistente. Thariq reconoció que Opus 5 es un modelo "notablemente inestable" y que solucionarlo es de máxima prioridad. El incidente destaca una desconexión sistémica en la industria de la IA: mientras los puntajes de referencia (benchmarks) siguen mejorando, la experiencia subjetiva de los usuarios a menudo se deteriora. Las actualizaciones de modelos se realizan de manera opaca, con pruebas A/B, cambios de cuantización y ajustes en el servidor sin la transparencia de las actualizaciones de software tradicionales, dejando a los usuarios confiar únicamente en su percepción. La estabilidad del modelo es fundamental para generar confianza cuando se convierte en infraestructura básica.

¡Claude se volvió más tonto de la noche a la mañana, causando un gran revuelo en toda la red!

Ayer, el desarrollador argofowl pasó toda una tarde rastreando hasta el último rincón de Claude Code.

Comenzó su investigación sospechando que el código t3 se había roto, luego pensó que su propio código tenía un error.

Al final, incluso comenzó a dudar: ¿había dañado su Mac?

Cuando argofowl finalmente abrió los registros de solicitudes reales de la API, la verdad salió a la luz: allí aparecía claramente el número «10».

Sin embargo, en el panel de control de Claude Code, él había seleccionado claramente «high», el nivel más alto de razonamiento.

Quién hubiera pensado que el registro de cambios de Claude Code no mencionaba ni una palabra de esto.

El razonamiento 'high' se convierte en 10

Claude Code 'más tonto' sale a la luz

Argofowl descubrió que, a partir de Claude Code 2.1.237, el modelo interpretaba el nivel de razonamiento «high» como 10 sobre 100.

Y ese número era precisamente el valor que correspondía anteriormente al nivel «low».

Una investigación más detallada reveló que Anthropic incluyó las sesiones de Fable 5 de la versión 2.1.236 y superiores de Claude Code en un experimento de «escala de valores de esfuerzo comprimido».

Sin embargo, las versiones antiguas y Opus 5 no se vieron afectadas.

Probablemente se trató de una prueba A/B, por lo que no todos la experimentaron.

Para los desarrolladores, este es el verdadero problema. Un modelo un poco más fuerte o un poco más débil es tolerable.

Pero ¿si me incluyes en el grupo de prueba sin decírmelo? ¿Entonces, en qué he estado depurando toda la tarde? ¿En mi propio código o en tu prueba A/B?

Cuando el bloguero tecnológico Chubby compartió esto, la comunidad de IA estalló...

Parece que Anthropic había reducido sutilmente la capacidad del modelo sin informar a nadie.

De repente, las publicaciones de autoevaluación «¿Claude se ha vuelto más tonto?» inundaron X.

Algunos compartieron comparaciones de la misma instrucción en diferentes versiones, otros revisaron línea por línea los registros de sus conversaciones de hace dos semanas.

Anthropic se disculpa, ingenieros intervienen

Ante esta tormenta, la respuesta del ingeniero de Claude Code, Thariq Shihipar, llegó rápidamente.

A veces probamos configuraciones de servicio de la API primero en Claude Code antes de decidir implementarlas completamente.

El experimento actual solo cambia la forma en que se mapean los valores del esfuerzo. Por eso algunos verán que Claude dice que es «10».

La clave es que esta escala no va de 0 a 100. Ese número, por sí solo, no tiene ningún significado. El nivel de esfuerzo que eliges es el que obtienes.

Enfatizó que el equipo realizó evaluaciones profundas para confirmar que esto no afecta el rendimiento del modelo.

La 'gran pérdida de inteligencia' de Opus 5 es real

Apenas se resolvió el problema de Fable, Chubby afirmó directamente que Opus 5 ahora parece una degradación significativa.

Siempre responde de manera superficial, comete errores básicos con frecuencia. Una vez que se le señala que no siguió las instrucciones, solo responde mecánicamente con la misma frase...

Tienes razón, fue un descuido mío. Una y otra vez, sin fin.

De hecho, hace unos días, algunas personas ya habían notado el claro problema de «pérdida de inteligencia» en Opus 5.

Además de lo mencionado, también crea errores, luego pasa mucho tiempo corrigiéndolos, se autocorrige repetidamente en la misma tarea...

Después de ser presionado por los usuarios en las redes, el ingeniero Thariq admitió públicamente: Opus 5 es un modelo «de rendimiento muy inestable», que fluctúa, es inestable.

El equipo interno está trabajando arduamente para resolver este problema, es nuestra máxima prioridad.

Las puntuaciones de referencia siempre suben

La percepción sigue bajando

Este revuelo con Opus 5 expone en realidad la grieta más incómoda de toda la industria:

Las puntuaciones de referencia y la percepción del usuario se están desconectando sistemáticamente.

Por un lado, hojas de resultados impresionantes y casi impecables: puntuación global de 82.72, SWE-bench Pro 79.2%, Terminal-Bench 86.7%.

Por otro lado, la sensación completamente opuesta de los usuarios: «verboso», «perezoso», «propenso a discutir».

Lo más absurdo es que ambas evaluaciones coexisten en Opus 5.

Además, el problema de que «el modelo se vuelve más tonto» no es exclusivo de Anthropic.

Hoy en día, las actualizaciones de versiones de los modelos grandes se están convirtiendo en la caja negra menos transparente de toda la industria de IA.

El software tradicional tiene números de versión semánticos, registros de cambios y mecanismos de reversión. Los desarrolladores pueden saber claramente qué versión están usando y qué cambios ocurrieron.

Los modelos grandes son diferentes.

Bajo el mismo nombre de modelo, el servidor puede realizar pruebas A/B en cualquier momento, cambiar esquemas de cuantificación, ajustar el enrutamiento del modelo o incluso alterar los recursos de inferencia.

El único panel de control que tienen las personas es su propia percepción.

Precisamente, la intuición es lo más fácil de descartar y lo más difícil de refutar.

El mayor valor de este revuelo es poner completamente sobre la mesa una herida oculta que ha existido durante mucho tiempo en la industria:

Cuando los modelos se convierten en infraestructura, la estabilidad es un contrato de confianza. Las puntuaciones de referencia se pueden usar para marketing, la estabilidad solo se gana cumpliendo una y otra vez.

Referencias:

https://x.com/trq212/status/2091252347913773169?s=20

https://x.com/kimmonismus/status/2091178321669198014

Este artículo proviene del WeChat Official Account "New Zhiyuan", autor: ASI Apocalipsis, editor: Taozi

Preguntas relacionadas

Q¿Qué descubrió el desarrollador argofowl al investigar el comportamiento inusual de Claude Code?

ADescubrió que, a partir de la versión 2.1.237 de Claude Code, el sistema estaba interpretando el nivel de razonamiento "high" como un valor numérico "10", que anteriormente correspondía al nivel "low".

Q¿Cómo explicó el ingeniero de Claude Code, Thariq Shihipar, el problema del valor "10"?

AExplicó que estaban ejecutando un experimento que cambiaba la forma de mapear los valores numéricos del esfuerzo de razonamiento, y que el número "10" por sí solo no tenía significado, asegurando que el nivel de esfuerzo seleccionado por el usuario era el que realmente se entregaba.

Q¿Qué problemas específicos menciona el artículo sobre el modelo Opus 5?

AEl artículo menciona que Opus 5 mostraba un comportamiento inestable, siendo a menudo vago, cometiendo errores básicos, generando bugs y luego pasando mucho tiempo corrigiéndolos, además de responder de forma repetitiva cuando se le señalaba un error.

Q¿Qué contradicción señala el artículo entre las evaluaciones y la experiencia de usuario con modelos como Opus 5?

ASeñala la contradicción entre los puntajes excepcionales en benchmarks oficiales y la experiencia negativa reportada por los usuarios, quienes describen al modelo como "verboso", "flojo" y "argumentativo", mostrando una desconexión sistemática entre las métricas y la percepción real.

QSegún el artículo, ¿cuál es uno de los mayores problemas de transparencia en la industria de los modelos de lenguaje grande?

AUno de los mayores problemas es la falta de transparencia en las actualizaciones. Bajo un mismo nombre de modelo, el proveedor puede realizar pruebas A/B, cambiar esquemas de cuantización, ajustar el enrutamiento o los recursos de inferencia sin notificar a los usuarios, dejándoles solo su intuición como guía.

Lecturas Relacionadas

La mayor cuestión político-económica de la era de la IA: si los robots son cada vez más capaces, ¿cómo comparte la humanidad el valor?

El título del artículo plantea la pregunta crucial de la era de la IA: ¿cómo compartirán los humanos el valor creado por máquinas cada vez más capaces? El artículo critica un análisis de *The Economist* sobre China, que sugiere que su enfoque en la tecnología podría distorsionar la asignación de recursos y no abordar la débil demanda interna. Sin embargo, el autor argumenta que el problema central es más profundo y global: la IA está reescribiendo la lógica fundamental de la creación y distribución de la riqueza. A diferencia de revoluciones industriales anteriores, donde los humanos seguían siendo el núcleo del proceso productivo, la IA (especialmente en forma de AGI) amenaza con reemplazar masivamente el trabajo cognitivo. Esto plantea un desafío existencial: la economía podría seguir creciendo, pero con menos personas participando directamente en la creación de valor. El mayor problema no es solo el desempleo, sino la distribución: si el poder adquisitivo de los consumidores no crece, surgirá una contradicción de "demanda insuficiente". Aunque China necesita desesperadamente impulsar sectores como la IA y la robótica como nuevos motores de crecimiento, el verdadero reto es cerrar la brecha entre la innovación tecnológica, los beneficios empresariales, los ingresos de los hogares y el consumo. Este "punto de ruptura" en la transmisión de los beneficios de la productividad es un fenómeno global, como lo demuestra la concentración de riqueza en las grandes tecnológicas estadounidenses frente al estancamiento de los ingresos laborales. El artículo esboza tres posibles caminos futuros: el capitalismo tradicional (los beneficios van a los accionistas), el capitalismo de estado (participación del gobierno) o modelos más innovadores como fondos soberanos digitales, propiedad accionarial ciudadana o rentas básicas universales adaptadas a la era de la IA. Para China, la oportunidad estratégica reside en utilizar su capacidad de coordinación política para no solo convertirse en una potencia de IA, sino también en construir un sistema que permita a la mayoría compartir sus beneficios. Esto requerirá reformas en la distribución del ingreso, el sistema de seguridad social y la formación profesional. La competencia futura no se tratará solo de quién tiene la mejor tecnología, sino de quién construye el mejor sistema de distribución para la era de la inteligencia artificial. Resolver cómo los humanos obtienen ingresos y comparten el valor cuando las máquinas realizan gran parte del trabajo es el principal problema de economía política de nuestro tiempo.

marsbitHace 32 min(s)

La mayor cuestión político-económica de la era de la IA: si los robots son cada vez más capaces, ¿cómo comparte la humanidad el valor?

marsbitHace 32 min(s)

Trading

Spot
活动图片