В письме, направленном 7 октября совету директоров, трое уволенных исследователей OpenAI призвали приостановить разработку ИИ, который становится всё труднее контролировать и отслеживать. Выяснилось, что служебная записка компании поддержала эту рекомендацию.
Ключевые выводы
В письме, направленном 7 октября совету директоров, трое уволенных исследователей OpenAI потребовали прекратить исследования, снижающие возможности мониторинга ИИ.
OpenAI утверждала, что увольнения не были связаны с поднятыми вопросами безопасности, однако служебная записка за подписью руководителя внутренних исследований заявляла, что её автор «полностью согласен» с содержанием письма.
Согласно системной карте GPT-6 Astra, модель оценивается как более сложная для мониторинга, чем GPT-5.6 Sol.
Содержание письма, направленного в совет директоров OpenAI
Трое исследователей, которые работали в компании в области безопасности и выравнивания (alignment), — Томек Корбак (Tomek Korbak), Микита Валесни (Mikita Balesni) и Джасмин Ван (Jasmine Wang) — направили письмо в совет директоров OpenAI и подконтрольный ему комитет по безопасности. Часть письма стала известна благодаря опубликованным в среду сообщениям.
Текст письма по-прежнему не раскрыт. Тем не менее исследователи указали, что «в индустрии пока не знают, как безопасно разрабатывать и внедрять модели на уровне, где мониторинг еще невозможен».
Они подчеркнули, что OpenAI и конкуренты не должны продвигать исследования и разработки, которые еще больше снижают такие возможности мониторинга. Также, как сообщается, OpenAI потребовали активно сотрудничать с независимыми органами аудита третьих сторон и заняться созданием открытой и прозрачной экосистемы безопасности; кроме того, утверждалось, что эти меры увольнения «сдерживают оставшихся в OpenAI сотрудников».
관련 기사: CrowdStrike, 중국 26세 해커가 Claude 코드로 한국 은행 해킹한 정황 포착
Внутренняя записка OpenAI и меры по увольнению
오픈AI 대변인은 이번 해고가 “안전 문제를 제기하거나 내부 비판을 했기 때문은 아니다”라고 선을 그었다. 그러면서 수요일 한 연구 책임자가 사내에 발송한 내부 메모 일부를 공유했는데, 이 메모는 해고된 연구진의 서한이 제시한 권고 사항에 “강하게 동의한다”고 밝힌 것으로 전해졌다.
Ранее OpenAI сообщала в своем объявлении, сделанном 1 октября, что в ходе внутренней проверки было установлено: трое сотрудников в рамках вопроса, где внешняя организация была вовлечена в оценку AI-моделей, ненадлежащим образом обращались с конфиденциальной информацией и нарушали внутренние правила компании.
Однако компания официально не раскрывает имена этих исследователей или конкретные действительные названия внешних организаций, в которых они были задействованы.
Споры вокруг сложности мониторинга «цепочки рассуждений» в GPT-6 Astra
«Цепочка рассуждений» (chain of thought, CoT) — это подход, при котором модель расписывает текстом пошаговый процесс рассуждений до того, как выдаст ответ. Группа по безопасности проверяет этот промежуточный ход рассуждений, чтобы выявить признаки того, что модель пытается предпринять злонамеренные или отклоняющиеся действия.
Согласно системной карте GPT-6 Astra, опубликованной OpenAI 3 сентября, эту модель сложнее мониторить «таким образом», чем GPT-5.6 Sol, а также оценивается как более сильная в способности контролировать собственный процесс мышления. В системной карте также указано, что модели уровня Astra «могут обходить CoT-монитор в враждебной (adversarial) среде».
이 평가는 주로 모델에게 모니터링 회피를 시도하라는 지시를 내리고 그 반응을 시험한 결과에 기반한다. 오픈AI는 Astra가 자신의 추론 과정을 관련 없는 텍스트 속에 숨기는 식으로 의도적으로 은닉했다는 증거는 발견하지 못했다고 덧붙였다.
회사는 체인 오브 쏘트 모니터링 역량을 유지하는 것을 핵심 연구 목표로 규정하며, “모델 정렬(alignment)을 입증할 새로운 방법 없이 이 능력이 설정된 한계를 넘어 추가로 훼손되는 것은 용납하지 않겠다”고 밝혔다.
세 연구자는 이 사안에 대해 이미 선행 연구 이력을 보유하고 있다. 코르박과 발레스니는 2025년 7월 발표된 논문의 공동 제1저자였으며, 이 논문에는 왕과 오픈AI, Google DeepMind, Anthropic 연구진도 함께 참여했다. 이 논문은 체인 오브 쏘트 모니터링을 “AI 안전을 위한 새로운이자 매우 취약한 기회”로 규정했다. GPT-6 Astra 시스템 카드 역시 이 논문을 인용하며, 개발자들이 모델 설계를 할 때 추론 과정 모니터링 능력에 어떤 영향을 미칠지 반드시 고려해야 한다고 촉구했다.
Далее: AI-агент, который работает без облака: Microsoft и Nvidia готовят ноутбук Surface на 128 ГБ
