Google, OpenAI и Anthropic поддерживают создание органа по стандартам безопасности ИИ, которое близко к формальному оформлению; бывший партнер Andreessen Horowitz Срирам Кришнан является одним из первых кандидатов на роль руководителя.
Основные выводы
Google, OpenAI и Anthropic поддерживают создание органа по стандартам безопасности ИИ, которое близко к формальному оформлению
Бывший партнер Andreessen Horowitz Срирам Кришнан — один из первых кандидатов на роль руководителя этого органа
Три лаборатории пришли к единому мнению по тестированию усовершенствований в области биозапрещённого оружия, кибер-возможностей и автономной репликации
Доверие зависело бы от доступа к весам моделей и обучающим данным, структуры финансирования и независимости
Согласно отчету, три лаборатории публикуют собственные рамки обеспечения безопасности для передовых моделей — документы с саморейтингом, описывающие, как они тестируют модели на катастрофическое злоупотребление до выпуска. Каждая пишет свою «политику ответственного масштабирования» и в значительной степени оценивает собственные задания, потому что ни одно госучреждение еще не утвердило обязательные технические стандарты для моделей на этом уровне возможностей.
Общий орган заменил бы три конкурирующих свода правил одним арбитром, которому лаборатории подчиняются.
В этом месяце Anthropic опубликовала исследование, показывающее, что Claude может вычислять амплитуду рассеяния с девятью контурами в теории N=4 супер-Янга—Миллса. Этот результат — проверка «сырого» рассуждения, а не бенчмарк по безопасности, и он поднимает отдельный вопрос: что именно такой бенчмарк должен был бы измерять.
Открытая публикация технических материалов такого рода по-прежнему остается исключением для всей отрасли.
Почему Google, OpenAI и Anthropic поделятся единым сводом правил
Команды по безопасности Google, OpenAI и Anthropic сблизились за последние два года в вопросах тестирования, включая усиление возможностей в области биологического оружия, киберспособности и автономное воспроизведение — даже при том, что они публикуют материалы отдельно. Один процесс аудита мог бы формализовать это сближение, сократить дублируемую работу по соблюдению требований и дать регуляторам одну точку отсчета вместо трех противоречивых.
Это также поможет ответить на критику, что заявления о безопасности являются маркетинговыми документами, а не независимыми аудитами.
Также читать: обновление OpenAI по кэшу GPT-6 добавляет контроль над стоимостью и задержками
Неравномерный путь от одиночных обещаний к совместному надзору
Передовые лаборатории уже пытались саморегулироваться. OpenAI, Anthropic и Google DeepMind в 2023 году подписали добровольные обязательства по ИИ с Белым домом, а затем резко разошлись в реализации: некоторые полностью пропускали независимое ред-тиминг-процедуры. Регуляторы в Вашингтоне и Брюсселе неоднократно приводили разное самопредставление данных как доказательство того, что добровольных рамок недостаточно.
Что на самом деле сделает этот орган реальным
Для Google, OpenAI и Anthropic доверие будет зависеть от того, получит ли орган доступ по типу судебного запроса к весам моделей и данным обучения, или увидит лишь ориентированные на маркетинг сводки, которые лаборатории уже публикуют.
Кадровое назначение руководителя сигнализирует о серьезности намерений, но структура финансирования и независимость от трех лабораторий-основателей определят, будет ли этот орган выступать в роли регулятора «в ожидании» или торговой ассоциации с более удачным брендингом.
Читать дальше: Инвесторы Alibaba имеют до 5 октября, чтобы возглавить иск против Anthropic