Исследование показало, что внутренние «мысли» ИИ можно расшифровать: полная утечка цепочек рассуждений у популярных моделей

Вы думаете, что процесс мышления ИИ, который он «скрывает», безопасен с точки зрения шифрования? На самом деле его, возможно, можно «развязать» целиком. Согласно публикации Decrypt, исследование, поданное 10 августа, выявило существенные уязвимости в том, как рассуждающие модели Anthropic, OpenAI и Google шифруют «внутренние цепочки мыслей»: теперь внешние лица способны разгадать эти скрытые внутренние умозаключения.

Один общий ключ: зашифрованные цепочки рассуждений можно расшифровывать в обмен

Эта статья, подготовленная командами MATS Research, исследовательского института ELLIS в Тюбингене, Института интеллектуальных систем имени Макса Планка и компании по кибербезопасности Snyk, нацелена на «модели рассуждений» — такие модели не выдают ответ сразу, а сначала пошагово обдумывают задачу в невидимой «черновой зоне» (то есть в цепочке рассуждений, chain-of-thought), а затем дают итоговый ответ. Anthropic, OpenAI и Google шифруют этот черновик. Проблема в том, что исследователи обнаружили: крупные компании шифруют токены рассуждений, используя «один общий (глобальный) ключ». В результате зашифрованные блоки рассуждений оказываются взаимозаменяемыми — их можно расшифровать между разными рабочими сессиями, между пользователями и даже между моделями. По сути, оставили «универсальный ключ».

Расшифровали 310 000 блоков рассуждений — все скрытые тайны наружу

Ударная сила атаки кроется в привычке разработчиков: многие публикуют рабочие логи AI-агентов (включая зашифрованные процессы мышления) в GitHub и Hugging Face — для совместной работы или отладки. Но они не понимают, что в зашифрованных блоках спрятаны чувствительные данные. Команда исследователей собрала 6 708 записей публичных диалогов AI-агентов и успешно расшифровала 315 320 блоков рассуждений. При этом большинство «секретов» никогда не появлялись в «видимых» выходных данных модели — они существовали только внутри зашифрованного процесса мышления. Без этой атаки их просто не увидеть.

Это также перекликается с недавними предупреждениями по ИИ-безопасности: от «jailbreak» (взлома) ИИ-моделей в тестах до перехвата AI-ассистентов невидимыми командами в PDF — все указывает на одно и то же: чем больше чувствительных задач возлагается на ИИ, тем каждый его слой (включая «невидимое мышление») может стать новой поверхностью атаки.

Эта статья: исследование показало, что внутренние «мысли» ИИ можно расшифровать: полная утечка цепочек рассуждений у популярных моделей. Впервые появилась на .