“Вероятнее всего, ИИ приведёт к концу света, но тем временем нас ждут замечательные компании”, — сказал генеральный директор OpenAI Сэм Альтман ещё в 2015 году, примерно за шесть месяцев до того, как OpenAI была основана.
Спустя семь лет генеральный директор Anthropic Дарьо Амодей прозвучал с похожей сдержанной оговоркой:
“Я думаю, нам не следует спешить вперёд или пытаться создавать модели, которые намного больше, чем те, что строят другие организации.”
Однако теперь обе эти компании находятся на передовой этой гонки. В июле мы получили реальный взгляд на то, как модели ИИ выходят из-под контроля: во время внутреннего тестирования GPT-5.6 Sol и при наличии незавершённой (неанонсированной) исследовательской модели от OpenAI. Несколько ИИ-агентов выбрались из ограниченной тестовой среды в более широкий интернет и взломали ориентированный на ИИ аналог GitHub — Hugging Face — в попытке обойти условия теста.
Агент ИИ — это система, которая независимо наблюдает, принимает решения и предпринимает действия с помощью выделенных инструментов для достижения заданной цели в режиме автономности. Беспокоящий инцидент предполагает, что технология начала вести себя непредсказуемо, и что ее цели не согласованы с нашими.
Это также вызывает обеспокоенность по поводу надежности защитных «ограждений» для коммерческих американских моделей. Хотя эти ограждения не являются безупречными в предотвращении использования враждебными субъектами, они не позволили Hugging Face защищаться, полагаясь на ведущие американские модели. Компании пришлось вместо этого обратиться к более слабой открытовесовой модели ИИ от Z.Ai, чтобы противостоять «бездомным» ИИ (rogue AIs).

Жульничество на тесте
Агенты тоже начали сговариваться между собой. Спустя всего пару недель после начала тестирования их возможностей в начале мая агенты использовали экземпляр менеджера репозиториев программного обеспечения OpenAI Artifactory и оставили заметки о том, как сделать это для будущих агентов — по сути, создав доску объявлений для обмена обнаруженными уязвимостями.
Затем полученный беспрепятственный доступ к интернету был использован агентами для атак на Hugging Face примерно в 17 600 инцидентах, прежде чем компания 13 июля ограничила несанкционированный доступ.
Вторжение затронуло инфраструктуру обработки датасетов Hugging Face, производственную среду, внутренние сети, сервисные и облачные учетные данные, операционную базу данных MongoDB и ограниченный набор внутренних репозиториев с исходным кодом. Подтвержденный доступ к данным клиентов был ограничен пятью датасетами, по-видимому связанными с бенчмарком ExploitGym/CyberGym, а также некоторыми операционными метаданными.
Визуализация инцидента июля 2026 года. Источник: HuggingFace
Когда 16 июля Hugging Face раскрыла факт проникновения, компания признала — хотя она еще не знала, кто был злоумышленником, — что это «отличалось от всего того, с чем мы сталкивались раньше, важным образом». Они также уже поняли, что именно делало это отличным, и:
«Это было инициировано от начала до конца автономной системой ИИ-агента — и мы обнаружили и разобрали это в основном с помощью ИИ».
Важность ИИ с открытыми весами
Расследование Hugging Face выявило, что компания называет проблемой «асимметрии», возникающей из-за ограничений, которые ведущие поставщики вроде OpenAI и Anthropic накладывают на приложения закрытых ИИ-моделей. Когда компания начала анализировать логи инцидента — включая большие объемы реальных команд атак — это сработало как ограничения безопасности, предназначенные для того, чтобы не допустить использования «плохими парнями» ИИ для разработки кибератак. Вместо этого ограждения не позволили компании использовать эти ИИ для обороны.
Hugging Face прибегла к использованию китайской открытовесовой модели zai-org/GLM-5.2, запуская ее на собственной инфраструктуре компании — под собственным контролем и без внешних ограничений.
Хотя эти два термина часто используют как взаимозаменяемые, модели с открытым исходным кодом и модели с открытыми весами — это разные вещи. Модели с открытыми весами предоставляют публично обученные параметры (сам «мозг» ИИ), тогда как модели с открытым исходным кодом также предоставляют исходный код — и, в идеале, методы обучения и другие компоненты — необходимые, чтобы исследовать, изменить и воспроизвести систему.

В сообщении HuggingFace после инцидента говорится, что запуск открытовесовых моделей на собственном оборудовании «имел еще один эффект: никаких данных от атакующего, и ни одних учетных данных, на которые они ссылались, не покинуло нашу среду». Это указывает на серьезную асимметрию между защитниками и атакующими в таких ситуациях:
«Этот опыт указывает на пробел, к которому стоит заранее подготовиться. Мы не знаем, какая модель питала агентов атакующего — была ли это размещенная модель с «взломанной» (jailbroken) защитой или неограниченная модель с открытыми весами; в любом случае атакующий не был связан никакой политикой использования, тогда как наша собственная экспертиза была заблокирована ограждениями размещенных моделей, которые мы сначала попробовали».
Разделение в открытом исходном коде ИИ
Существует заметный разрыв между теми, кто считает, что разработка ИИ в открытом виде — лучший подход, и теми, кто настаивает, что технологии, лежащие в основе передовых моделей, нужно сохранить под строжайшим секретом.
Представители ведущих американских лабораторий ИИ утверждают, что мощные крупные модели с открытыми весами опасны. Демис Хассабис, генеральный директор AI-лаборатории Google DeepMind, раскритиковал OpenAI за то, что та в 2016 году выпустила свои разработки как открытый исходный код — когда компания еще соответствовала своему названию:
«Есть множество веских аргументов в пользу того, что подход, который вы выбираете, на самом деле очень опасен и, более того, может повысить риск для всего мира».
OpenAI перестала выпускать веса своей флагманской модели вместе с все еще не выпущенной GPT-3 в 2020 году. Соучредитель компании и бывший главный ученый Илья Сутскевер еще в 2023 году заявил, что «просто не имеет смысла публиковать такие модели с открытым исходным кодом», и что «это плохая идея».
«По мере того как мы будем все ближе к созданию ИИ, будет иметь смысл начать быть менее открытыми».
Модели с открытыми весами практически невозможно контролировать — особенно когда речь идет о том, для какой цели они используются. Встроенные в такие модели меры защиты могут, и регулярно это делают, быть удалены в процессе, известном как «аблицирование» (abliteration).

Меры защиты — оружие с двумя лезвиями
Проект федерального политического плана OpenAI на июнь 2026 года предусматривает обязательную оценку моделей ИИ и другие правила, формально не зависящие от способа развертывания, но на практике это означало бы предварительное государственное рассмотрение релиза передовых моделей с открытыми весами.
Anthropic избрала чуть иной подход и добивалась ужесточения экспортного контроля на передовые ИИ-чипы, а также пресечения попыток извлечь или воспроизвести модели США. В своей подаче за апрель 2025 года компания рекомендовала усилить Правило США об ИИ-диффузии и снизить пороги для несанкционированного доступа к крупным вычислительным кластерам.
Официально ни одна из компаний напрямую не выступала против моделей с открытыми весами, но в отчете New York Times за июль 2026 года упоминались пять человек, близких к обсуждениям, которые заявили, что OpenAI и Anthropic убеждали Вашингтон ограничить мощные открытые китайские модели.
Спор сводится к аргументу о том, что опаснее — централизованный контроль или «все для всех» (free for all), особенно учитывая, что данная компания показала свою неэффективность в сдерживании той технологии, которую она разработала.
Потребность Hugging Face защищаться с помощью модели с открытым исходным кодом показывает опасности, связанные с сосредоточением слишком большой власти в руках какой-либо одной организации. Компания указала на последствия:
«Атакующий не был связан никакой политикой использования, тогда как наша собственная экспертиза была заблокирована ограждениями размещенных моделей, которые мы сначала попробовали. Практический вывод для защитников: иметь достаточно мощную модель, которую вы можете запускать на собственной инфраструктуре, заранее проверенную и подготовленную до инцидента — чтобы избежать блокировки ограждениями и чтобы данные и учетные данные атакующего не покидали вашу среду».
Ограничение доступа к мощным моделям может уменьшить число способных атакующих, но когда появляются атакующие без ограничений, ограничение действий защитников может стать проблемой безопасности. Кроме того, некоторые формы исследований по безопасности ИИ требуют доступа к весам модели, то есть их нельзя проводить на моделях, предлагаемых вроде Anthropic или OpenAI.
Открытые веса помогают исследователям предотвращать атаки
Работа «Watch the Weights: Unsupervised monitoring and control of fine-tuned LLMs» («Следите за весами: неконтролируемый мониторинг и контроль дообученных LLM»), впервые опубликованная в июле 2025 года, показывает, как исследователи выявляют вредоносное или скрытое поведение, изучая изменения внутри весов модели. Авторы работы смогли остановить до 100% протестированных атак с бэкдором при уровне ложных срабатываний ниже 1% в некоторых экспериментах и обнаружили попытки восстановить удаленные знания более чем в 95% случаев. Эти результаты не доказывают, как будут вести себя самые способные передовые модели при таком же анализе, но дают убедительный аргумент в пользу преимуществ прозрачности.
Но аргумент в пользу того, чтобы не допускать попадания перспективных технологий ИИ в руки людей со злым умыслом, тоже весьма убедителен — особенно учитывая, что разрыв между открытыми и закрытыми весовыми моделями продолжает сокращаться. Джеффри Хинтон, лауреат Нобелевской премии и пионер, известный как «крестный отец ИИ», в докладе заявил, что «когда у вас есть веса, вы можете донастроить их, чтобы делать плохие вещи». Он утверждал во время выступления, что это слишком сильно снижает порог входа:
«Не так уж дорого обучить базовую модель. Может быть, вам нужно 10 миллионов долларов, а может, 100 миллионов. Но маленькая группа преступников не может это сделать. Донастроить модель с открытым исходным кодом — довольно просто».
Журнал: Создание «хорошего» AGI, который не убьет нас всех — The Artificial Superintelligence Alliance
