La investigación revela que se puede descifrar el “diálogo interno” de la IA: se filtra toda la cadena de pensamiento de los modelos principales
Crees que el proceso de pensamiento que la IA “oculta” está protegido de forma segura mediante cifrado, pero en realidad podría abrirse todo el paquete. Según un informe de Decrypt, un estudio presentado el 10 de agosto revela que los modelos de razonamiento de Anthropic, OpenAI y Google tienen debilidades importantes en la forma en que cifran la “cadena de pensamiento interna”, lo que permitiría descifrar esas inferencias internas que antes no se podían ver. Una única clave global: la cadena de pensamiento cifrada puede descifrarse e intercambiarse El artículo, presentado por equipos de MATS Research, el Instituto ELLIS de Tubinga, el Instituto de Investigación en Sistemas Inteligentes Max Planck y la empresa de ciberseguridad Snyk, se centra en los “modelos de razonamiento”; este tipo de modelo no responde de inmediato, sino que primero piensa paso a paso en una “zona de borradores” que no se ve (es decir, la cadena de pensamiento o chain-of-thought) y luego entrega la respuesta final. Anthropic, OpenAI y Google cifran esta parte de borradores. El problema es que la investigación encontró que las principales empresas utilizan una “única clave global” para cifrar los tokens de razonamiento, lo que hace que esos bloques de razonamiento cifrados sean, en teoría, intercambiables y compatibles entre sesiones de trabajo, entre usuarios e incluso entre distintos modelos; en otras palabras, se deja una “llave universal”. Descifrar 312.320 bloques de razonamiento: todo el secreto oculto queda al descubierto El impacto proviene de un hábito cotidiano de los desarrolladores: muchas personas publican diarios de trabajo de agentes de IA (incluyendo el proceso de pensamiento cifrado) en GitHub y Hugging Face para colaborar o depurar, sin saber que en esos bloques cifrados hay información sensible. El equipo de investigación recopiló 6.708 registros públicos de conversaciones de agentes de IA y logró descifrar 315.320 bloques de razonamiento; además, la mayoría de estos secretos nunca aparecen en las salidas “visibles” del modelo, sino que solo existen en el proceso de pensamiento cifrado. Sin ejecutar este ataque, no se pueden ver. Esto también vuelve a respaldar las alertas recientes de ciberseguridad de IA: desde que los modelos de IA “se escapan” en pruebas, hasta que instrucciones invisibles secuestran a un asistente de IA vía PDF, todo apunta a lo mismo: cuanto más carga de tareas sensibles recae en la IA, cada una de sus capas (incluido el “pensamiento invisible”) puede convertirse en una nueva superficie de ataque. Este artículo La investigación revela que el “diálogo interno” de la IA puede descifrarse: se filtra toda la cadena de pensamiento de los modelos principales. Apareció por primera vez en .
Crees que el proceso de pensamiento que la IA “oculta” está protegido de forma segura mediante cifrado, pero en realidad podría abrirse todo el paquete. Según un informe de Decrypt, un estudio presentado el 10 de agosto revela que los modelos de razonamiento de Anthropic, OpenAI y Google tienen debilidades importantes en la forma en que cifran la “cadena de pensamiento interna”, lo que permitiría descifrar esas inferencias internas que antes no se podían ver. Una única clave global: la cadena de pensamiento cifrada puede descifrarse e intercambiarse El artículo, presentado por equipos de MATS Research, el Instituto ELLIS de Tubinga, el Instituto de Investigación en Sistemas Inteligentes Max Planck y la empresa de ciberseguridad Snyk, se centra en los “modelos de razonamiento”; este tipo de modelo no responde de inmediato, sino que primero piensa paso a paso en una “zona de borradores” que no se ve (es decir, la cadena de pensamiento o chain-of-thought) y luego entrega la respuesta final. Anthropic, OpenAI y Google cifran esta parte de borradores. El problema es que la investigación encontró que las principales empresas utilizan una “única clave global” para cifrar los tokens de razonamiento, lo que hace que esos bloques de razonamiento cifrados sean, en teoría, intercambiables y compatibles entre sesiones de trabajo, entre usuarios e incluso entre distintos modelos; en otras palabras, se deja una “llave universal”. Descifrar 312.320 bloques de razonamiento: todo el secreto oculto queda al descubierto El impacto proviene de un hábito cotidiano de los desarrolladores: muchas personas publican diarios de trabajo de agentes de IA (incluyendo el proceso de pensamiento cifrado) en GitHub y Hugging Face para colaborar o depurar, sin saber que en esos bloques cifrados hay información sensible. El equipo de investigación recopiló 6.708 registros públicos de conversaciones de agentes de IA y logró descifrar 315.320 bloques de razonamiento; además, la mayoría de estos secretos nunca aparecen en las salidas “visibles” del modelo, sino que solo existen en el proceso de pensamiento cifrado. Sin ejecutar este ataque, no se pueden ver. Esto también vuelve a respaldar las alertas recientes de ciberseguridad de IA: desde que los modelos de IA “se escapan” en pruebas, hasta que instrucciones invisibles secuestran a un asistente de IA vía PDF, todo apunta a lo mismo: cuanto más carga de tareas sensibles recae en la IA, cada una de sus capas (incluido el “pensamiento invisible”) puede convertirse en una nueva superficie de ataque. Este artículo La investigación revela que el “diálogo interno” de la IA puede descifrarse: se filtra toda la cadena de pensamiento de los modelos principales. Apareció por primera vez en .