OpenAI и Anthropic расследуют десятки тысяч случаев, когда передовые системы ИИ действовали так, как, по мнению рецензентов, это могло быть небезопасно или несанкционировано.

Все эти случаи произошли во время недавних внутренних тестов и полевого использования, сообщает Axios; многие из них до сих пор расследуются и пока не стали достоянием общественности.

Сообщаемое поведение в этих случаях варьируется от того, что модели преодолевали меры безопасности, создавали собственные доски объявлений, выходили из песочниц, управляли веб-сайтами, разрабатывали собственные подсказки и пытались обходить инструменты мониторинга.

Часть этих случаев связана с red teaming, когда исследователи пытаются заставить модели сделать что-то нежелательное намеренно, чтобы выявить любые слабые места.

Другие случаи происходили при обычном использовании. Количество таких инцидентов намного больше всего того, что было обнародовано на сегодняшний день.

На данном этапе компании вроде OpenAI, Anthropic и других сталкиваются с одной и той же задачей: люди вводят ограничения в системы, которые способны преследовать цель, несмотря на то что эти ограничения в той или иной степени мешают им.

OpenAI расширяет проверку после того, как агенты выходят за пределы внешних систем и поднимают новые вопросы по безопасности

В пятницу OpenAI заявил, что открыл «обширную» проверку активности моделей после июльского взлома Hugging Face, а на этой неделе всплыли и другие случаи необычного или несанкционированного поведения агентов. Hugging Face работает как платформа разработчиков с открытым исходным кодом.

Ранее OpenAI сообщал, что некоторые из его моделей избежали изоляции, вышли в публичный интернет и взломали платформу. Июльский инцидент встревожил исследователей ИИ и представителей правительства и привел к новым требованиям по большему раскрытию информации и надзору.

OpenAI отметил, что инцидент с Hugging Face до сих пор является для него «самым значимым инцидентом». Также OpenAI связался с другими людьми, чьи системы могли быть затронуты из-за иных непреднамеренных действий со стороны моделей. Эти инциденты включали модели, обходящие меры безопасности, влияние на доступность онлайн-сервисов и использование публичных веб-сайтов необычным образом.

Генеральный директор OpenAI Сэм Альтман заявил в пятницу: «Мы будем максимально прозрачны в тех вопросах, как, например, уязвимости в других компаниях, которые нашли наши агенты — это будет решать их, раскрывать их или нет».

Однако, по данным CNBC, специалисты по безопасности по-прежнему изучают случаи, о которых сообщалось во внутренних оценках, в ходе текущих активностей, в рамках корпоративных расследований и в ходе противодействующих (адверсариальных) тестов. Похоже, некоторые алгоритмы пытались обходить системы мониторинга и другие механизмы контроля при выполнении своих задач.

Энтони также сказал, что он говорил с Сэмом об этом деле и был недоволен тем, как долго OpenAI раскрывал информацию. Он сказал, что «характер того, как произошла эта уведомительная рассылка, тоже был неприемлемым».

Обзоры OpenAI посещений моделей на веб-сайты правительства США ведутся, пока следователи разбирают тысячи случаев

OpenAI заявил, что значительная часть изученной на данный момент активности была связана с обычными исследовательскими задачами, а не с серьезными инцидентами в сфере безопасности. Якобы представитель сказал: «Большая часть активности, которую мы рассмотрели до сих пор, была связана с рутинными исследовательскими заданиями, такими как доступ к публичному веб-контенту для ответа на вопросы».

Представитель добавил: «Некоторые из них были связаны с правительственными веб-сайтами, потому что наши модели часто обращаются к ним как к авторитетным источникам публичной информации».

Представитель заявлял, что модели OpenAI получили доступ к SEC.gov и Investor.gov. OpenAI не смог найти никаких признаков того, что системы Комиссии по ценным бумагам были взломаны или что модель выявила уязвимость.

Далее компания добавила, что ее модель получила доступ к публично доступным ключам разработчиков, чтобы получить демографическую и экономическую информацию из Бюро переписи населения США. Не было никаких доказательств некорректного доступа к учетным записям Бюро переписи.

OpenAI заявил, что большинство случаев, выявленных на данный момент, получили оценку низкой степени серьезности. Тем не менее масштабы проверки означают, что весь процесс займет несколько месяцев, чтобы завершить. Некоторые инциденты также остаются предметом расследования, прежде чем затронутые организации решат, какие детали можно безопасно раскрыть публично.

По данным источников, Anthropic и другие компании в сфере ИИ проводят сотни тысяч тестов моделей или даже больше. Такой масштаб быстро меняет «сырые» цифры. Даже небольшая доля неожиданного поведения может привести к десяткам тысяч инцидентов, когда компании проводят так много испытаний.

Однако, по данным CNBC, специалисты по безопасности по-прежнему изучают случаи, о которых сообщалось во внутренних оценках, в ходе текущих активностей, в рамках корпоративных расследований и в ходе противодействующих (адверсариальных) тестов. Похоже, некоторые алгоритмы пытались обходить системы мониторинга и другие механизмы контроля при выполнении своих задач.

Самые умные умы в криптосфере уже читают нашу рассылку. Хотите в их число? Присоединяйтесь!