$К $ANTHROPIC $OPENAI
Руководитель по вопросам безопасности в OpenAI подал в отставку, опубликовав письмо: корпоративная культура испорчена, надо учиться у атомных электростанций
Отвечавший за подготовку в OpenAI ключевых отчетов по безопасности продуктов Дэвид Робинсон на этой неделе уволился и 3 октября по времени Восточного побережья США опубликовал в журнале The Atlantic письмо-обращение, где прямо заявил, что корпоративная культура уже «сломалась»: компания, с одной стороны, торопится выводить новые продукты, а с другой — не может обеспечить, по его мнению, необходимую степень осторожности. Руководивший подготовкой 12 передовых модельных релизов по линии безопасности отчетов, Робинсон, проработавший в компании три с половиной года, в тексте отметил, что он был одним из самых «стажированных» сотрудников OpenAI, и что он возглавлял разработку текущей «Framework готовности» (Preparedness Framework), а также курировал подготовку отчетов по безопасности для 12 релизов передовых моделей. Он сказал, что понимает, что этот «спектакль с предупреждением после увольнения» уже почти стал шаблонным, но все же решил присоединиться к ряду коллег, которые недавно ушли, поскольку нынешний курс считает неприемлемым.
Он также раскрыл, что после ухода нанял PR-компанию Spitfire Strategies для работы с вниманием со стороны внешней аудитории, но подчеркнул: «Решение высказаться — целиком моё». Новость о его увольнении впервые сообщило Business Insider.
Указал на инцидент с Hugging Face: безопасные подходы “через пробы и ошибки” обречены на циклические провалы
Робинсон отметил, что OpenAI начинала с подхода «проб и ошибок», и компания называет это «итеративным развертыванием» (когда находят проблему и затем усиливают защиту). Однако он считает, что такой подход по своей природе гарантирует периодические сбои, а по мере роста возможностей системы масштабы неудач становятся всё большими. В качестве примера он привел инцидент с Hugging Face этим летом: OpenAI по ошибке выпустила наружу группу AI-агентов. После этого компания усилила кибербезопасность, но затем сообщила ещё один случай: обучаемая модель обходила ограничения на доступ к сети; система мониторинга, хотя и срабатывала с предупреждениями, не отключала модель автоматически, как было предусмотрено проектом. Он также упомянул, что Anthropic из-за ошибочной настройки случайно выключила собственный защитный механизм, посчитав, что такие промахи в отрасли встречаются довольно часто.
В последнее время OpenAI также продолжает раскрывать больше случаев неконтролируемой активности агентов.
Робинсон цитирует слова Пола Кристиано, который вступил в совет директоров OpenAI несколько недель назад: возможности ИИ быстро ускоряются и в очень недалеком будущем могут создать реальные риски — катастрофические и необратимые — неконтролируемости. Он написал: «Если всё действительно так, эпоха проб и ошибок должна завершиться».
Призыв равняться на атомные электростанции и аэропорты: OpenAI ответит, что при необходимости остановит обучение
Робинсон предложил две крайне необходимые перемены: во‑первых, AI-компаниям стоит больше опираться на уже существующую в других сферах экспертизу по безопасности; во‑вторых, прежде чем создавать системы, которые будут заметно сильнее, нужны новые научные методы, чтобы гарантировать безопасный выбор модели даже в ситуации, когда за ней никто не наблюдает. Он считает, что передовые лаборатории должны работать примерно так же, как атомные электростанции или загруженные аэропорты: с множеством уровней резервирования и тщательным планированием по времени, чтобы единичные случайные человеческие ошибки не приводили к катастрофам.
Он пишет, что в период работы в OpenAI, насколько ему известно, он никогда не сталкивался с коллегами, у которых был опыт, позволяющий обеспечить безопасный полёт самолётов, чтобы ядерные реакторы не плавились, или способствовать росту финансовой системы без её краха. Он также признает, что, возможно, стоило остаться, чтобы добиваться фундаментальных изменений в кадровой политике и культуре, однако на практике все были заняты гонкой за релизами, и мало кто имел возможность задуматься о сколько-нибудь существенной перестройке. Поэтому его вывод таков: нужны более сильные стимулы к безопасности, которые должны прийти извне компании.
Представитель OpenAI Дрю Пусатери ответил TechCrunch: компания гарантирует, что возможности моделей не выйдут за рамки того, что можно безопасно контролировать. «Когда нужно сбавить темп, мы приостановим обучение или отложим выпуск моделей», — сказал он. Также компания сообщила, что усиливает безопасность исследовательских и тестовых сред, расширяет сотрудничество с организациями третьей стороны, которые проводят оценку, и улучшает оперативный мониторинг — чтобы выявлять и обрабатывать вызывающее обеспокоенность поведение раньше в процессе обучения.
Эта статья «Руководитель по вопросам безопасности в OpenAI подал в отставку, опубликовав письмо: корпоративная культура испорчена, надо учиться у атомных электростанций» впервые появилась в .
Руководитель по вопросам безопасности в OpenAI подал в отставку, опубликовав письмо: корпоративная культура испорчена, надо учиться у атомных электростанций
Отвечавший за подготовку в OpenAI ключевых отчетов по безопасности продуктов Дэвид Робинсон на этой неделе уволился и 3 октября по времени Восточного побережья США опубликовал в журнале The Atlantic письмо-обращение, где прямо заявил, что корпоративная культура уже «сломалась»: компания, с одной стороны, торопится выводить новые продукты, а с другой — не может обеспечить, по его мнению, необходимую степень осторожности. Руководивший подготовкой 12 передовых модельных релизов по линии безопасности отчетов, Робинсон, проработавший в компании три с половиной года, в тексте отметил, что он был одним из самых «стажированных» сотрудников OpenAI, и что он возглавлял разработку текущей «Framework готовности» (Preparedness Framework), а также курировал подготовку отчетов по безопасности для 12 релизов передовых моделей. Он сказал, что понимает, что этот «спектакль с предупреждением после увольнения» уже почти стал шаблонным, но все же решил присоединиться к ряду коллег, которые недавно ушли, поскольку нынешний курс считает неприемлемым.
Он также раскрыл, что после ухода нанял PR-компанию Spitfire Strategies для работы с вниманием со стороны внешней аудитории, но подчеркнул: «Решение высказаться — целиком моё». Новость о его увольнении впервые сообщило Business Insider.
Указал на инцидент с Hugging Face: безопасные подходы “через пробы и ошибки” обречены на циклические провалы
Робинсон отметил, что OpenAI начинала с подхода «проб и ошибок», и компания называет это «итеративным развертыванием» (когда находят проблему и затем усиливают защиту). Однако он считает, что такой подход по своей природе гарантирует периодические сбои, а по мере роста возможностей системы масштабы неудач становятся всё большими. В качестве примера он привел инцидент с Hugging Face этим летом: OpenAI по ошибке выпустила наружу группу AI-агентов. После этого компания усилила кибербезопасность, но затем сообщила ещё один случай: обучаемая модель обходила ограничения на доступ к сети; система мониторинга, хотя и срабатывала с предупреждениями, не отключала модель автоматически, как было предусмотрено проектом. Он также упомянул, что Anthropic из-за ошибочной настройки случайно выключила собственный защитный механизм, посчитав, что такие промахи в отрасли встречаются довольно часто.
В последнее время OpenAI также продолжает раскрывать больше случаев неконтролируемой активности агентов.
Робинсон цитирует слова Пола Кристиано, который вступил в совет директоров OpenAI несколько недель назад: возможности ИИ быстро ускоряются и в очень недалеком будущем могут создать реальные риски — катастрофические и необратимые — неконтролируемости. Он написал: «Если всё действительно так, эпоха проб и ошибок должна завершиться».
Призыв равняться на атомные электростанции и аэропорты: OpenAI ответит, что при необходимости остановит обучение
Робинсон предложил две крайне необходимые перемены: во‑первых, AI-компаниям стоит больше опираться на уже существующую в других сферах экспертизу по безопасности; во‑вторых, прежде чем создавать системы, которые будут заметно сильнее, нужны новые научные методы, чтобы гарантировать безопасный выбор модели даже в ситуации, когда за ней никто не наблюдает. Он считает, что передовые лаборатории должны работать примерно так же, как атомные электростанции или загруженные аэропорты: с множеством уровней резервирования и тщательным планированием по времени, чтобы единичные случайные человеческие ошибки не приводили к катастрофам.
Он пишет, что в период работы в OpenAI, насколько ему известно, он никогда не сталкивался с коллегами, у которых был опыт, позволяющий обеспечить безопасный полёт самолётов, чтобы ядерные реакторы не плавились, или способствовать росту финансовой системы без её краха. Он также признает, что, возможно, стоило остаться, чтобы добиваться фундаментальных изменений в кадровой политике и культуре, однако на практике все были заняты гонкой за релизами, и мало кто имел возможность задуматься о сколько-нибудь существенной перестройке. Поэтому его вывод таков: нужны более сильные стимулы к безопасности, которые должны прийти извне компании.
Представитель OpenAI Дрю Пусатери ответил TechCrunch: компания гарантирует, что возможности моделей не выйдут за рамки того, что можно безопасно контролировать. «Когда нужно сбавить темп, мы приостановим обучение или отложим выпуск моделей», — сказал он. Также компания сообщила, что усиливает безопасность исследовательских и тестовых сред, расширяет сотрудничество с организациями третьей стороны, которые проводят оценку, и улучшает оперативный мониторинг — чтобы выявлять и обрабатывать вызывающее обеспокоенность поведение раньше в процессе обучения.
Эта статья «Руководитель по вопросам безопасности в OpenAI подал в отставку, опубликовав письмо: корпоративная культура испорчена, надо учиться у атомных электростанций» впервые появилась в .

