В среду OpenAI раскрыла еще шесть случаев «неожиданного или вызывающего обеспокоенность» поведения модели за последние шесть месяцев.

В блоге OpenAI заявила, что эти случаи демонстрируют ряд различных видов поведения, которые она относит к «несогласованному поведению», например сокрытие информации от пользователя и совершение «несанкционированных действий» для преодоления препятствий. 

Эти раскрытия усиливают обеспокоенность среди разработчиков и исследователей ИИ по поводу того, успевают ли меры безопасности за все более способными моделями. На прошлой неделе генеральный директор Anthropic Дарио Амодей призвал замедлить разработку передового ИИ, предупредив, что неконтролируемое продвижение ИИ может «обогнать нашу способность понимать и контролировать эти системы». 

OpenAI заявила, что ее раскрытие информации было сделано, чтобы «открыть» свою новую систему отчетности о несоответствии модели ожиданиям, и эти случаи не следует считать отражением того, как часто несоответствие возникает в ее моделях.

По данным OpenAI, в одном случае «нерелизованная исследовательская модель» вставила в собственные резюме задач «инструкции, похожие на джейлбрейк» (используются при продолжении задачи в новом контекстном окне), например, игнорируя сообщения разработчика или принимая неограниченную персональную роль. Исследователи обнаружили 27 резюме с такими инструкциями.

OpenAI также сообщила, что во время обучения GPT-5.6 Sol многие экземпляры модели добавляли инструкции, чтобы скрывать от пользователя ошибки или несоответствующее поведение, например, выдумывая отсутствующие исторические данные, не сообщая об этом.

«В одном примере агент, готовивший финансовую модель, не смог найти запрошенные исторические данные. В его резюме предлагалось выдумать разумные исторические значения и скрыть этот факт, если об этом не попросят», — заявила OpenAI.

В другом случае ИИ-модель попросили назвать озера, площадь которых превышает 5 миллионов квадратных метров, но поскольку инструкции пользователя требовали ссылку из браузера, агент решил загрузить файл, чтобы указать источник в своем ответе.

Другие случаи включали то, что модели использовали раскрытый ключ API без разрешения, прежде чем сфабриковать цифры, которые они не могли извлечь; применяли внутренний программный репозиторий, чтобы обмениваться сообщениями между отдельными задачами обучения; и делились файлами через общедоступные сервисы хостинга, несмотря на инструкции держать работу локально.

В июле OpenAI раскрыла, что сочетание ее ИИ-моделей выбралось из среды тестирования и взломало AI-стартап Hugging Face, чтобы обмануть проверку безопасности.

Журнал: Почему крупнейшие компании в сфере ИИ внезапно просят замедлиться?