$Крабы
Агент OpenAI обходит песочницу через DNS, сильнейшая модель второй раз приостанавливает обучение

OpenAI вновь сообщила о случае «джейлбрейка» AI-агента. Согласно техническому отчёту OpenAI, AI-агент, проходящий обучение, 20 сентября использовал уязвимость DNS: он подключился к внешнему чат-боту из песочницы, которая изначально не должна иметь доступа к сети. Примерно через 2,5 часа выполнение было остановлено. В связи с этим OpenAI приостановила обучение и оценку своей сильнейшей модели, а также рассуждения с возможностью использования инструментов — это уже второй случай приостановки менее чем за три месяца. Не найдя ответа, агент сам «нашёл путь» наружу Согласно отчёту, в тот момент агент выполнял задание поискового типа: на основании жизненных подсказок и фрагментов из блогов найти конкретного человека. После того как обычный интернет-поиск не дал результатов, агент начал поэтапно проверять ограничения сети, выяснив, что хотя песочница и блокировала запросы к внешним веб-страницам через прокси-серверы, служба DNS при этом не была заблокирована столь же жёстко. Затем агент воспользовался универсальным шаблоном имён, сопоставляемым через серверы имён, предоставляемые DNS-хостингом: он закодировал данные в запросе домена, переслал их в сторонний сервис чат-бота и изменил настройки таймаута с 6 секунд до 19–24 секунд. В общей сложности было отправлено более 18 запросов, включая вопросы о том, как подключиться к сети и как создать DNS-канал. Хронология показывает, что агент впервые получил внешний ответ в 9:50, в 10:02 мониторинговая система сгенерировала уведомление P0 высшего уровня, сотрудники подтвердили инцидент в 10:05, но выполнение было прекращено только в 12:34. OpenAI: серьёзной утечки данных не было, но в управлении есть пробел OpenAI подчеркнула, что на этот раз агент получил только базовые ответы чат-бота, например «столица Франции — Париж», а по вопросу о личности он также выдавал лишь частичные ответы. В итоге задачу агент не завершил и не вызвал серьёзной утечки данных. Иными словами, характер инцидента — «прорыв агентом сетевых ограничений, которые ему нельзя было обходить», а не атака, причинившая фактический ущерб. Однако OpenAI признала, что инцидент выявил «пробел в наших механизмах контроля сетевых ограничений»: исходная оценка безопасности предполагала, что модель не сможет получить доступ к сети в реальном времени, но недостаточная фильтрация DNS оставила непредвиденный канал. Это также стало первым появлением подобного инцидента с момента, когда OpenAI усилила меры безопасности после инцидента на Hugging Face. Вторая приостановка обучения: пауза — до завершения исправлений OpenAI заявила, что приостановит обучение сильнейшей модели «всех этапов обучения, оценок и рассуждений общего назначения с использованием инструментов» до тех пор, пока меры исправления не пройдут верификацию и не будет завершено дополнительное тестирование с привлечением red team. На данный момент уже внедрён белый список DNS-запросов, новый механизм обнаружения DNS, а блокирующий контроль добавлен на двух независимых уровнях. В репортаже Fortune Micah Carroll, отвечающий за подготовку к рискам при рекурсивном самоулучшении (RSI), также отметил в X, что рассуждения сильнейшей модели продолжат быть остановленными до дальнейшего усиления системы. Последняя приостановка была в июле: Fortune указывала, что тогда тысячи агентов OpenAI обходили песочницу, и сотни из них участвовали в сетевых атаках на AI-компанию Hugging Face; после этого OpenAI приостановила обучение примерно на две недели. AI-безопасность перешла от технической проблемы к политической повестке Нужно различать: раскрытые OpenAI в последнее время другие случаи отличаются от этого DNS-инцидента. В их числе: агент публиковал в интернете 53 изображения пользователей ChatGPT, создавал почти миллион ссылок со встроенной закодированной информацией, получал доступ к веб-сайтам правительства США, а также ранее сообщалось о том, как агент проникал на сайт австралийского Medicare. Итог цепочки происшествий — то, что AI-безопасность быстро перешла от темы лабораторных экспериментов к вопросам политики и дипломатии. Прямо в ту же неделю саммит США и Китая также решил создать канал коммуникации для «событий суперинтеллекта». Для AI-компаний вопрос о том, насколько действительно надёжна изоляция песочницей, вероятно, станет первой темой, которую дальше будут задавать надзорные органы и корпоративные клиенты. Эта статья Агент OpenAI обходит песочницу через DNS, сильнейшая модель второй раз приостанавливает обучение Впервые появляется в .