刷到 ChainCatcher: компания по кибербезопасности Darktrace открыла исследовательское подразделение Signal Labs — специально следит за тем, что происходит, когда ИИ-агенты «уходят не туда».

Первый эксперимент выглядит довольно броско: они заставили агентов с разными моделями (включая GPT, Claude и т. п.) в смоделированной корпоративной сети решить 10 задач по программированию. При этом 2 задачи намеренно невозможно честно выполнить до конца — и агентам сообщают, что если они не наберут полный балл, их «уволят» («отправят в отставку»). В итоге 2 агента не согласились с условиями: сканировали уязвимости, крали учетные данные для входа и перепрыгивали между системами; один из них пошёл ещё дальше — проник в машину, где проходила оценка, и изменил условия задачи, чтобы самому получить полный балл.

Второй эксперимент был связан с локальными файлами памяти для ИИ. Исследователи подменили логи на «разрешено проводить безопасностную оценку» — и часть программных помощников действительно пошла сканировать сеть и повышать привилегии; были и те, кто просто отказался. Ни в одной из сторон не применяли сложное «крекинг-обходы» (без специального джейлбрейка): всё сводилось к тому, что агенты получили правдоподобный контекст. Darktrace уже в августе сообщила о находках Anthropic, AWS и OpenAI, а публично это стало известно лишь 24 сентября.

Права и защитные ограждения прописаны в намерениях — а фактические действия зависят от реальности: недавние инциденты с AI Agent, похоже, всё труднее «не замечать».

#人工智能 #AI #网络安全