2026-08-03 Lunes

Noticias Cripto - Página 131

Mantente a la vanguardia del mercado de cripto. Noticias en tiempo real, análisis, precios, historias en tendencia y opiniones de expertos - todo en un solo lugar.

¿Ley de Escalado es la solución universal? El primer benchmark de operaciones de estructura cristalina expone las limitaciones de los grandes modelos lingüístísticos líderes

**Artículo: ¿La Ley de Escalado no es suficiente? Primer benchmark de manipulación de estructuras cristalinas, donde los principales modelos grandes fracasan colectivamente.** La famosa "Ley de Escalado" (Scaling Law), que sugiere que los modelos de IA mejoran simplemente al aumentar su tamaño y datos, encuentra un límite en tareas científicas prácticas. El benchmark **AtomWorld**, presentado en ICML 2026, evalúa la capacidad de los modelos de lenguaje grande (LLMs) para manipular estructuras atómicas siguiendo instrucciones en lenguaje natural, como reemplazar átomos, rotar grupos o crear superficies cristalinas. Los resultados son reveladores: aunque modelos más grandes como Claude Opus 4.6, GPT-5.4 o Qwen mejoran en tareas sencillas y bien definidas (p. ej., sustituir un átomo), su rendimiento es bajo e inestable en operaciones que requieren comprensión geométrica tridimensional y razonamiento espacial, como "rotar alrededor de un átomo" (solo ~12% de éxito). Ampliar el modelo no garantiza una mejora automática en estas habilidades de acción. El estudio concluye que para la IA aplicada a la ciencia (AI for Science), el enfoque debe evolucionar. No basta con escalar el conocimiento lingüístico ("Language Scaling"); es necesario un "**Action Scaling**": generar datos a gran escala que emparejen instrucciones con acciones atómicas precisas, incorporando retroalimentación y restricciones físicas durante el entrenamiento. Solo así los modelos podrán pasar de *entender* el conocimiento científico a *ejecutar* tareas de investigación de manera fiable, convirtiéndose en verdaderos asistentes de laboratorio.

marsbit07/15 04:03

¿Ley de Escalado es la solución universal? El primer benchmark de operaciones de estructura cristalina expone las limitaciones de los grandes modelos lingüístísticos líderes

marsbit07/15 04:03

GPT-5.6 Sol de repente se vuelve más tonto, ¿el presupuesto de razonamiento se reduce de 960 a 128? ¿Ya no hay un modelo de inteligencia fija?

El equipo japonés que usaba Codex Sol MAX para tareas complejas notó un repentino descenso en su rendimiento: de una calidad "12 o 13" cayó a un "8", perdiendo profundidad en el razonamiento. La queja se repitió en la comunidad: el modelo responde más rápido, pero parece menos reflexivo. Los usuarios investigaron y descubrieron un parámetro interno no documentado: el "juice value". Este valor, que refleja el presupuesto de cómputo para razonamiento, habría bajado de 960 a 128 para el modo Max, una reducción del ~87%. Simultáneamente, el contexto útil se redujo de ~372k a ~272k tokens. Tibo (Thibault Sottiaux) de OpenAI respondió que no hubo "nerf" (reducción de inteligencia). Explicó que estaban optimizando la eficiencia del razonamiento para liberar capacidad (~10% más de uso para suscriptores). También citó un experimento para analizar un uso mayor al esperado, en el que ajustaron temporalmente el "juice value" (esfuerzo de razonamiento), pero ya lo revirtieron. Asimismo, mencionó que están ajustando el uso de multi-agentes y auto-revisiones. El incidente destaca la tensión entre la eficiencia operativa de la plataforma y la experiencia del usuario. Para los usuarios, un "juice value" más bajo se traduce en que el modelo "piensa menos". El debate expone cómo el rendimiento percibido de un modelo puede variar mediante parámetros de configuración internos que controla el proveedor, llevando a algunos a comparar el servicio con una "bombilla cuya intensidad controla la plataforma". La comunidad pide más transparencia sobre las garantías específicas que ofrece cada nivel de servicio.

marsbit07/15 03:35

GPT-5.6 Sol de repente se vuelve más tonto, ¿el presupuesto de razonamiento se reduce de 960 a 128? ¿Ya no hay un modelo de inteligencia fija?

marsbit07/15 03:35

La batalla por las plataformas de lanzamiento en Robinhood Chain: ¿NOXA cierra y Uniswap CCA toma su lugar?

La cadena Robinhood ha generado un gran interés tras su lanzamiento gracias a las memecoins, alcanzando un volumen de transacciones semanal en DEX de más de $3,100 millones. La plataforma de lanzamiento más popular, NOXA, que generó millones en tarifas y lanzó el principal meme CASHCAT, suspendió repentinamente la creación de nuevos tokens el 11 de julio. Esto provocó caídas en el valor de sus memes más importantes y dejó un vacío en el ecosistema. Su decisión, atribuida al exceso de tokens 'spam' y ataques de 'vampiros', ha generado dudas en la comunidad sobre una posible 'huida suave'. Mientras tanto, Uniswap ha introducido su mecanismo de subasta CCA (Continuous Clearing Auctions) en Robinhood Chain. Este sistema busca una distribución más justa y estable de nuevos tokens, evitando picos de precios abruptos al inicio. Sin embargo, su idoneidad para el mercado volátil de memes es debatida, ya que los creadores pueden retener tokens no vendidos. En resumen, Robinhood Chain ha logrado un rápido crecimiento impulsado por el frenesí de las memecoins. La salida de NOXA ha abierto una competencia por dominar las lanzaderas de tokens, con Uniswap presentando una alternativa estructurada. La estrategia a largo plazo de la cadena parece ser usar este momentum inicial para luego desarrollar un ecosistema de activos tokenizados (RWA).

marsbit07/15 03:30

La batalla por las plataformas de lanzamiento en Robinhood Chain: ¿NOXA cierra y Uniswap CCA toma su lugar?

marsbit07/15 03:30

活动图片