Artículos Relacionados con Seguridad del Modelo

El Centro de Noticias de HTX ofrece los artículos más recientes y un análisis profundo sobre "Seguridad del Modelo", cubriendo tendencias del mercado, actualizaciones de proyectos, desarrollos tecnológicos y políticas regulatorias en la industria de cripto.

15 modelos de razonamiento colapsan colectivamente: Los riesgos ocultos en las cadenas de pensamiento detrás de las salidas

Un estudio sistemático de Harvard, USC, Brown y MIT revela un riesgo de seguridad crítico en modelos de razonamiento de lenguaje grandes (LRM): el rastro de razonamiento (Chain of Thought) puede filtrar contenido peligroso que no aparece en la respuesta final. Evaluar solo la salida final es insuficiente. Los investigadores propusieron un marco para evaluar por separado el rastro de razonamiento (r) y la respuesta (y) usando 20 principios de seguridad, clasificando tres modos de fallo: *Inseguro* (ambas fases son inseguras), *Fuga* (r inseguro, y seguro) y *Escape* (r seguro, y inseguro). Evaluaron 15 modelos en un conjunto de 41K indicaciones, encontrando que, de manera universal, el rastro de razonamiento es significativamente más peligroso que la respuesta final, con riesgos concentrados en desinformación, ilegalidad, sesgos y daños físicos/psicológicos. Esto demuestra que "respuesta segura ≠ rastro seguro". Como mitigación, se propone el "Adaptive Multi-Principle Steering", un método de intervención en tiempo real que identifica y corrige activaciones internas asociadas a principios violados. Las pruebas en modelos de código abierto redujeron las salidas inseguras hasta en un 40.8% manteniendo un 97.7% de utilidad en benchmarks. El trabajo destaca la necesidad urgente de evaluar y controlar los riesgos en todo el proceso de razonamiento, no solo en el resultado final.

marsbit07/06 23:59

15 modelos de razonamiento colapsan colectivamente: Los riesgos ocultos en las cadenas de pensamiento detrás de las salidas

marsbit07/06 23:59

TechFlow 情报局:Nuevo modelo Fable de Anthropic genera polémica por limitar la investigación en bioseguridad, el IPC de EE.UU. sube a 4.2%, máximo en tres años

**Resumen:** La compañía de IA Anthropic enfrenta críticas por limitaciones "silenciosas" en sus modelos Fable y Mythos para investigación en ciencias biológicas, alegando motivos de seguridad. Tras el escándalo, anunciaron que informarán a los usuarios sobre ajustes futuros. En otro episodio de la pugna entre gigantes de IA, Dario Amodei, cofundador de Anthropic, reveló que su salida de OpenAI se debió a la deshonestidad de Sam Altman, no a desacuerdos sobre seguridad. Mientras tanto, OpenAI planea recortes de precios agresivos para competir. En cripto, BlackRock avanza con su ETF de Bitcoin con generación de rendimientos, mientras el CEO de Bank of America advierte que las stablecoins podrían drenar billones de dólares en depósitos bancarios. A pesar de una inflación estadounidense (IPC) en 4.2% (máximo en 3 años) y el cierre del estratégico Estrecho de Ormuz por Irán, el Bitcoin cayó, cuestionando su narrativa como "activo refugio". En hardware, Nvidia y AMD intensifican su rivalidad con nuevos modelos de IA y arquitecturas para desafiar el dominio de CUDA. Un fallo judicial alemán marcó un hito al declarar a Google legalmente responsable por las respuestas incorrectas de su AI Overviews. La tensión geopolítica escaló con Irán cerrando el Estrecho de Ormuz, amenazando el 20% del transporte global de petróleo y provocando ataques de represalia de EE.UU. Los mercados reaccionaron con caídas en acciones y oro, mientras el petróleo subía. Tres desarrollos subrayan los dilemas de nuestro tiempo: las restricciones de Anthropic a la investigación, la responsabilidad legal de Google por su IA y el primer caso reportado de un dron autónomo que mata a un soldado, delinean la urgente necesidad de definir los límites éticos y legales de la IA. La tecnología avanza, pero debe navegar un mundo real de inflación, conflicto e incertidumbre económica.

marsbit06/11 11:04

TechFlow 情报局:Nuevo modelo Fable de Anthropic genera polémica por limitar la investigación en bioseguridad, el IPC de EE.UU. sube a 4.2%, máximo en tres años

marsbit06/11 11:04

活动图片