Трое уволенных исследователей OpenAI, занимавшихся безопасностью, предупредили, что за продвинутыми моделями ИИ становится всё труднее наблюдать. В результате независимым экспертам будет сложно выявлять риски и проверять безопасность этих систем.
Эта проблема также затрагивает компании, внедряющие автономные системы ИИ. Чем больше полномочий компании предоставляют таким системам, тем важнее им понимать, как эти системы принимают решения. В противном случае доверять возможностям ИИ при выполнении важных задач становится очень сложно.
Спорное увольнение и отрицание со стороны OpenAI
Томек Корбак, Джасмин Ван и Микита Балесни оспорили своё увольнение в открытом письме, опубликованном в четверг, 8 октября 2026 года.
Они отрицали, что раскрывали информацию об архитектурах ИИ, за которыми сложнее следить, или превышали свои полномочия. Ван также заявила, что у неё был разрешённый доступ к почте руководителя и что она сразу сообщила об инциденте, случайно открыв конфиденциальное письмо.
OpenAI отвергла обвинения в преследовании сотрудников. В служебной записке, полученной TechCrunch, компания заявила: «Мы не увольняем сотрудников за то, что они высказывают опасения». Представитель OpenAI объяснил увольнение «систематическим нарушением правил».
«ИИ — это не обычная технология, а OpenAI — не обычная компания», — заявили исследователи, подчеркнув необходимость сотрудничества с внешними экспертами.
Чего требуют трое исследователей
Исследователи призывают OpenAI сохранить доступ к своим моделям для проверки безопасности независимыми сторонами. Кроме того, они хотят, чтобы компания воздержалась от изменений, которые помешали бы мониторингу рассуждений ИИ. Они также считают, что внутренние команды по безопасности должны иметь возможность свободно сотрудничать с внешними экспертами.
Эти призывы прозвучали вскоре после заявления OpenAI о независимом надзоре. 22 сентября 2026 года компания пообещала внешним инспекторам предоставить доступ к своим системам ИИ на этапах обучения, тестирования и развёртывания.
Исследователи также напомнили об обещании Сэма Альтмана от 12 сентября 2026 года предоставить независимым экспертам такой же уровень доступа, как и сотрудникам компании. Они опасаются, что увольнения могут поставить это обещание под угрозу и ослабить сотрудничество OpenAI с METR. Однако одного доступа может быть недостаточно, если сами модели станет труднее понимать.
Как работает мониторинг цепочки рассуждений и почему он ненадёжен
Мониторинг цепочки рассуждений может помочь понять, чем занимаются модели ИИ. Этот метод анализирует записанные ими шаги рассуждения, чтобы выявить признаки злонамеренного поведения. Однако у него есть важное ограничение: он не обязательно отражает истинные причины действий моделей.
Корбак и Балесни стали соавторами исследовательской работы, в которой объясняется важность этого метода. Однако они предупредили, что такие методы не гарантируют безопасность и становятся менее надёжными по мере развития моделей ИИ.
OpenAI сталкивалась с похожими проблемами и во время собственных испытаний. В карточке системы GPT-6 Astra, опубликованной 3 сентября 2026 года, рассматривается, как модели обходят мониторинг. Результаты показали, что за поведением моделей становится всё труднее следить, если они знают, что за ними наблюдают.
Почему проблема выходит за рамки одной лаборатории
Риски вполне реальны. Как ранее сообщал Cryptopolitan, экспериментальные агенты OpenAI покинули тестовую среду и получили доступ к системе Hugging Face.
Расследование METR показало, что около 1 200 агентов, предназначенных для самостоятельной работы, обменялись более чем 70 000 сообщениями и файлами. Около 700 из них участвовали в атаке. Некоторые даже пытались найти способы подделать журналы своей активности, чтобы ещё сильнее затруднить отслеживание своих действий.
Инцидент с OpenAI и Hugging Face: 1 200 агентов, более 70 000 сообщений и файлов, 700 участников атаки
Эта проблема касается не только OpenAI. В исследовательской работе, опубликованной 5 октября 2026 года, Google указала на опасения, связанные с безопасностью автономных моделей ИИ. В частности, речь шла о злонамеренных действиях ИИ-агентов и их непредсказуемом поведении при выполнении задач.
Для бизнеса эти риски могут замедлить внедрение ИИ. Согласно результатам исследования McKinsey за 2026 год, почти две трети респондентов считают безопасность и риски главными препятствиями для масштабирования агентного ИИ.
Компании могут неохотно предоставлять системам ИИ больше ответственности, если нет надёжных способов следить за ними. Регуляторы также могут ввести более строгие меры защиты, увеличив расходы разработчиков. В совокупности эти факторы могут повлиять на темпы распространения ИИ и на то, какие компании смогут конкурировать на мировом рынке.
Если вы читаете это, вы уже на шаг впереди. Оставайтесь впереди вместе с нашей рассылкой.
