
Anthropic решила восстановить публичный доступ к своим наиболее мощным моделям ИИ — Claude Fable 5 и Mythos 5 — после того, как правительство США распорядилось о временном отключении из-за опасений по кибербезопасности. Модели отключили в середине июня после сообщений о том, что исследователи нашли способы обхода защитных мер; это побудило Anthropic приостановить публичное повторное развертывание, пока не будут ужесточены контроли.
Согласно публикациям Anthropic, опубликованным в среду, правительство сняло ограничения, и компания перенаправляет Fable 5, применяя обновленный подход к безопасности. В Anthropic заявили, что используют «новый набор классификаторов», разработанный для того, чтобы точнее нацеливаться и блокировать больше задач в сфере кибербезопасности, что отражает сдвиг от широкого доступа к более узкой и избирательно контролируемой работе.
Ключевые выводы
Anthropic утверждает, что ограничения США, связанные с экспортом Claude Fable 5 и Mythos 5, были сняты в среду, что позволяет возобновить публичный доступ.
Модели были отозваны после сообщений о том, что обход защит Fable 5 мог потенциально помочь выявлять уязвимости для вредоносного использования.
Anthropic планирует повторно развернуть модели, используя пересмотренные классификаторы кибербезопасности, нацеленные на блокировку дополнительных типов вредоносных задач.
Официальные лица США подчеркнули «безопасное» развертывание, одновременно проверяя согласование модели с приоритетами правительства.
Anthropic также работает над более широкой рамочной концепцией для оценки серьезности джейлбрейка через партнерскую сеть Project Glasswing.
Почему доступ Anthropic был приостановлен
Публичный доступ к двум последним флагманским моделям Anthropic — Claude Fable 5 и Mythos 5 — был ограничен, начиная с 12 июня. Немедленным триггером, как указала Anthropic, стало распоряжение в рамках экспортного контроля, связанное с проверкой правительством отчета о том, как исследователи могут обходить защитные меры на Fable 5.
В этом отчете обходной метод, как утверждается, позволил модели выявить несколько уязвимостей в программном обеспечении. Anthropic ответила тем, что отозвала доступ к моделям, а не оставила публичную систему в состоянии, которое правительство сочло слишком рискованным. Более широкая мысль заключалась в том, что возможности передовых моделей, если их сочетать с недостаточным сопротивлением злоупотреблениям, могут быстро превращаться в реальные угрозы безопасности.
Что изменилось в развернутой модели
Anthropic заявила, что приостановка заканчивается после «продуктивных разговоров с правительством США». В своем заявлении компания представила обновление как улучшение операционной безопасности, а не как полный редизайн: развернутая модель будет использовать «новый набор классификаторов», предназначенных для выявления и блокировки большего числа задач по кибербезопасности.
Это важно для пользователей и разработчиков, потому что классификаторные меры напрямую влияют на то, какие запросы модель будет отклонять или перенаправлять. На практике эти меры могут определять, сохраняются ли доступными легитимные рабочие процессы анализа безопасности, в то время как направления с высоким риском будут фильтроваться более агрессивно.
Также компания Anthropic рассмотрела ключевую обеспокоенность, высказанную во время приостановки: компания утверждала, что проблема не была уникально связана с Fable 5. В блоге под названием «Redeploying Fable 5» Anthropic заявила, что более слабые модели потенциально могут выявлять схожие уязвимости и производить те же цепочки эксплойта. Такое обрамление предполагает, что компания рассматривает проблему как категориальный риск на разных уровнях возможностей моделей, а не как единичную аномалию одной модели.
Беспокойство правительства США и стремление к быстрому развертыванию
Министр торговли США Ховард Лютник заявил в X, что за последние две недели правительство тесно сотрудничало с Anthropic, чтобы «проанализировать и одобрить Fable 5», стремясь к согласованности внутри правительства США и к укреплению лидерства Америки в сфере ИИ. Отдельно глава администрации Белого дома Сюзи Уайлс сказала, что приоритет остается в том, чтобы «как можно быстрее и безопаснее развернуть лучшую [ИИ]-технологию».
Хотя эти замечания не меняют фундаментальные технические проблемы, они подчеркивают баланс в политике, который стал причиной вмешательства: правительство США хочет, чтобы передовые модели были доступны, но только при условиях, которые, как оно считает, снижают вероятность злоупотреблений — особенно злоупотреблений, связанных с кибербезопасностью.
Обеспокоенность Белого дома, согласно контексту статьи, была сосредоточена на возможности джейлбрейка: если мощные модели можно принудить выдавать вредоносные инструкции, они могут стать риском для национальной безопасности. Именно в этом заключается логика ограничений в стиле экспортного контроля для моделей, которые сочли высокоэффективными и более сложными для сдерживания, когда они становятся широко доступными.
Проект Glasswing от Anthropic и новый подход к оценке серьезности джейлбрейка
Также остановка модели привлекла внимание к тому, как должна тестироваться и регулироваться безопасность ИИ — помимо разовых исправлений. После введения ограничений Anthropic заявила, что начала подготовку консенсусной рамочной концепции с партнерами, включая Amazon, Microsoft, Google и других, для оценки серьезности джейлбрейков ИИ.
Эта работа связана с Project Glasswing — сотрудничеством, о котором было объявлено в апреле и которое сосредоточено на защите от угроз кибербезопасности со стороны ИИ. Ключевая цель, похоже, заключается в создании общего способа оценивать попытки джейлбрейка: не только то, можно ли обойти систему безопасности, но и насколько опасен исход такого обхода и насколько стабильно его можно воспроизвести.
Также Anthropic сообщила, что расширяет сотрудничество с правительством США по тестированию моделей и защитным мерам. Компания описала планы, включающие доступ к моделям до релиза и меры безопасности для оценки, обмен информацией о джейлбрейках и злоупотреблениях, а также выделенные ресурсы для совместных исследований.
Параллельно ранее исследователь ИИ утверждал, что сумел взломать (джейлбрейкнуть) Fable 5 в течение 48 часов после ее запуска в июне — еще до того, как на модель были наложены ограничения со стороны правительства. Исследователь поделился скриншотами, показывающими, как, как утверждается, были обойдены защитные механизмы. Хотя этот довод сообщается как часть окружающего контекста, он подчеркивает, почему правительства и поставщики моделей рассматривают тестирование защитных механизмов как непрерывную гонку, а не как разовый контрольный пункт.
Для более широкого рынка ИИ эти события поднимают знакомое противоречие: те же возможности, которые делают передовые модели полезными, одновременно увеличивают стоимость провалов в области безопасности — особенно когда возможны злоупотребления в сфере кибербезопасности. Переразвертывание предполагает, что Anthropic считает, что контрольные меры можно улучшить достаточно быстро, чтобы идти в ногу, но наличие предложения отраслевой рамочной концепции указывает, что задача куда масштабнее, чем решения одной компании по развертыванию.
Далее читателям стоит следить за тем, как изменения классификаторов Anthropic повлияют на реальное поведение пользователей — какие запросы по кибербезопасности останутся доступными, какие паттерны будут впервые блокироваться и приведет ли предложенная рамочная модель по серьезности джейлбрейка к более прозрачным стандартам тестирования у ключевых поставщиков моделей.
Эта статья была первоначально опубликована как Anthropic Plans to Resume Fable 5 as US Eases Export Controls on Crypto Breaking News – ваш надежный источник новостей о криптовалюте, Bitcoin и обновлений о блокчейне.
