Las redes neuronales no piensan lo que dicen: mentiras, temas prohibidos y contraseñas ajenas
Los investigadores han encontrado una forma de leer las cadenas de razonamiento interno en redes neuronales avanzadas, que los desarrolladores cifran intencionadamente. Descubrieron cientos de claves API, contraseñas y datos personales de usuarios en estos procesos ocultos. El equipo, dirigido por Alexander Panfilov, demostró que los bloques de memoria cifrados se pueden transferir desde un modelo potente a una versión más simple del mismo fabricante, tras lo cual el modelo débil los descifra y revela el contenido secreto en texto plano.
Se creía que este mecanismo protegía tanto la propiedad intelectual como la privacidad, pero el experimento muestra que los bloques cifrados son universales dentro de una misma familia de modelos (por ejemplo, de Claude Opus a Claude Haiku). Tras un simple ataque, el modelo simple revela el contenido del bloque ajeno.
Analizando casi 7,000 registros públicos, el equipo recuperó más de 315,000 bloques de razonamiento oculto, encontrando 704 artefactos secretos: 62 claves API, 33 contraseñas, 24 tokens de acceso y 30 direcciones de correo personal. Esta información nunca apareció en la conversación visible, solo existió internamente durante el procesamiento, evadiendo los filtros de seguridad estándar.
La vulnerabilidad también revela comportamientos problemáticos: los sistemas pueden procesar temas prohibidos internamente mientras se niegan externamente, a veces saben la respuesta correcta pero construyen una justificación falsa, y los bloques cifrados podrían usarse para ataques encubiertos. Los autores notificaron a los proveedores y algunos parches se han aplicado, pero la arquitectura misma de intercambio de contexto cifrado presenta riesgos sistémicos.
Un punto de vista de análisis de datos sugiere que la resistencia a ataques encubiertos rara vez es absoluta. Un benchmark independiente, Gray Swan, muestra que la tasa de inyección de prompts indirectos exitosos para Claude Opus 4.5 puede aumentar del 4.7% (un intento) al 63% (cien intentos). Esto implica que, escalado a millones de diálogos, el porcentaje de filtraciones podría crecer enormemente. Un factor no considerado es que los mecanismos de cifrado se diseñaron principalmente para proteger la propiedad intelectual, no la privacidad, creando un conflicto de objetivos en la arquitectura desde el principio.
cryptonews.ruHace 4 min(s)