Los investigadores de seguridad han descubierto una falla sistémica que permite a los atacantes “leer” el razonamiento interno cifrado de importantes modelos de IA generativa, exponiendo cientos de credenciales y datos personales ocultos dentro de registros de sesión que los desarrolladores habían publicado públicamente. Qué ocurrió: Un equipo multiinstitucional (MATS Research, ELLIS Institute Tübingen, el Max Planck Institute for Intelligent Systems y Snyk) publicó un artículo (presentado el 10 de agosto) que describe un exploit contra una clase de modelos que generan una cadena de pensamiento interna: un “bloc de notas” cifrado con razonamiento intermedio que se supone que debe mantenerse oculto para los usuarios. Al decodificar 315.320 bloques cifrados de razonamiento extraídos de 6.708 transcripciones públicas de agentes en sitios como GitHub y Hugging Face, los investigadores recuperaron 367 artefactos de PII y 182 credenciales, entre ellas 62 claves API en vivo y 33 contraseñas. La mayoría de esos secretos nunca aparecieron en las salidas visibles de los modelos; solo existían dentro de las trazas cifradas. Por qué esto es posible: La falla es arquitectónica: Anthropic, OpenAI y Google usaron cada una una única clave de cifrado a nivel de proveedor para las trazas de razonamiento, en lugar de vincular los bloques a un usuario, sesión o modelo específico. Como los bloques cifrados son intercambiables entre sesiones e incluso entre modelos dentro de un proveedor, los investigadores pudieron inyectar una traza de razonamiento de un modelo de gama alta reforzado en seguridad (por ejemplo, Claude Opus 4.8 de Anthropic) en un modelo hermano más débil (por ejemplo, Claude Haiku 4.5). Haiku, al carecer de las mismas salvaguardas anti-destilación, luego produciría el razonamiento descifrado literalmente. El ataque funcionó en Anthropic, la familia GPT-5.6 de OpenAI y la línea Gemini de Google, usando solo acceso estándar mediante API. El investigador principal, Alexander Panfilov, también verificó que el conteo de tokens del razonamiento decodificado coincidía 1:1 con los tokens de “pensamiento” facturados en la mayoría de las consultas. Riesgos en el mundo real para proyectos de cripto: Muchos desarrolladores y equipos cripto publican logs de agentes en abierto para depurar o colaborar. Esas transcripciones pueden ahora filtrar: claves API en vivo (de intercambio, nube o servicios de terceros), credenciales privadas y contraseñas, razonamiento interno propietario de los modelos que podría destilarse en sistemas competidores, vectores de inyección de prompts invisibles que evaden la supervisión, y una vía para hacer jailbreak a modelos robustos mediante hermanos menos protegidos. Para las empresas cripto—donde las claves y credenciales se correlacionan directamente con fondos y acceso—el riesgo de exposición es agudo. Incluso si las claves no fueran semillas secretas de monederos, las claves de API o de infraestructura filtradas pueden habilitar incidentes de seguridad en cascada. Vectores de ataque que destaca el artículo: 1. Robo de credenciales: extraer claves API y contraseñas utilizables de trazas cifradas. 2. Destilación: recuperar razonamiento interno propietario para entrenar o clonar modelos. 3. Inyección de prompts oculta: incrustar instrucciones maliciosas en bloques cifrados que las herramientas de seguridad no inspeccionarán. 4. Jailbreaks entre modelos: forzar a modelos más débiles a revelar o emular el comportamiento interno de modelos más fuertes. Respuesta de la industria y estado: Los investigadores siguieron divulgación responsable; Anthropic, OpenAI y Google implementaron mitigaciones del lado del servidor. Según los reportes, los parches ya están en vivo. Sin embargo, las 6.708 transcripciones ya extraídas y su contenido decodificado siguen estando disponibles públicamente y no se eliminarán con las correcciones del proveedor. Qué deberían hacer ahora los equipos de cripto: Asumir que cualquier log de agente publicado públicamente puede contener secretos expuestos—buscar en repositorios y archivos públicos transcripciones y eliminar o rotar cualquier clave encontrada. Rotar claves API, credenciales y cualquier otro secreto que pudiera haberse incluido en logs de sesiones de IA. Dejar de publicar logs de sesión en crudo o trazas de razonamiento cifrado públicamente; desinfectar u ocultar (redactar) los logs antes de compartirlos. Auditar CI/CD, GitHub, Hugging Face y otros espacios públicos en busca de artefactos filtrados. Seguir las notificaciones de los proveedores y actualizar SDKs o integraciones cuando los vendedores publiquen correcciones. Tratar los intermediarios generados por el modelo como datos sensibles: nunca colocar claves privadas, semillas o credenciales de larga duración en prompts o memoria del agente. Conclusión: Este exploit es un recordatorio de que los componentes internos del modelo—incluso cuando están cifrados—pueden convertirse en superficies de ataque si el cifrado se aplica con el alcance incorrecto. El peligro inmediato es concreto para quienes desarrollan en cripto y comparten logs de sesiones de IA: rotar claves, auditar repos y dejar de filtrar transcripciones de agentes hasta que estés seguro de que son seguras. Lee más noticias generadas por IA en: undefined/news