В одном тесте по кибербезопасности одна и та же модель ИИ отклонила все начальные запросы, а затем успешно прошла 34 из 50 испытаний при другом уровне доступа.
Anthropic сообщила об этом контрасте 6 октября, одновременно расширив свою программу Cyber Verification Program. Компания протестировала Claude Opus 5.5 на десяти многоэтапных кибериспытаниях, предприняв по пять попыток для каждого. Без доступа к программе все попытки сразу блокировались. С доступом Red Team Access не блокировалась ни одна попытка, и 34 из них завершились успешно.
Эти результаты отражают собственную оценку Anthropic, а не независимый аудит безопасности. Но они выявляют проблему с таким простым вопросом, как «Способна ли эта модель выполнить задачу?». Отказ может рассказать о мерах защиты учётной записи раньше, чем о возможностях самой модели.
В новой программе три уровня доступа. Defense Access охватывает такие задачи, как реагирование на инциденты и анализ уязвимостей; он может предоставляться и отдельным исследователям, которые уже сообщали об обнаруженных уязвимостях. Red Team Access также разрешает санкционированное тестирование на проникновение, но на данный момент недоступен частным лицам. Specialized Access предназначен для ограниченного числа проверенных организаций, тестирующих особо чувствительные системы.
Для небольшой команды, разрабатывающей торговое ПО или кошелёк, это различие влияет на то, как оценивать инструмент ИИ для обеспечения безопасности. Обычная проверка кода и поиск уязвимостей в исходном коде, которым вы владеете, по-прежнему доступны и без участия в программе. Задача, в которой модель должна выполнить наступательную операцию, — совсем другое дело, с иными требованиями к доступу. Одна лишь оплата мощной модели не решает вопрос с доступом.
Из 34 успешных испытаний Anthropic также следует, что 16 завершились неудачей. Снятие блокировки позволяет попробовать выполнить задачу, но не гарантирует надёжность ответа.
Источник: https://www.anthropic.com/news/cyber-verification-program
Изображение: редакционная иллюстрация, созданная ИИ; это не объект Anthropic.
Anthropic сообщила об этом контрасте 6 октября, одновременно расширив свою программу Cyber Verification Program. Компания протестировала Claude Opus 5.5 на десяти многоэтапных кибериспытаниях, предприняв по пять попыток для каждого. Без доступа к программе все попытки сразу блокировались. С доступом Red Team Access не блокировалась ни одна попытка, и 34 из них завершились успешно.
Эти результаты отражают собственную оценку Anthropic, а не независимый аудит безопасности. Но они выявляют проблему с таким простым вопросом, как «Способна ли эта модель выполнить задачу?». Отказ может рассказать о мерах защиты учётной записи раньше, чем о возможностях самой модели.
В новой программе три уровня доступа. Defense Access охватывает такие задачи, как реагирование на инциденты и анализ уязвимостей; он может предоставляться и отдельным исследователям, которые уже сообщали об обнаруженных уязвимостях. Red Team Access также разрешает санкционированное тестирование на проникновение, но на данный момент недоступен частным лицам. Specialized Access предназначен для ограниченного числа проверенных организаций, тестирующих особо чувствительные системы.
Для небольшой команды, разрабатывающей торговое ПО или кошелёк, это различие влияет на то, как оценивать инструмент ИИ для обеспечения безопасности. Обычная проверка кода и поиск уязвимостей в исходном коде, которым вы владеете, по-прежнему доступны и без участия в программе. Задача, в которой модель должна выполнить наступательную операцию, — совсем другое дело, с иными требованиями к доступу. Одна лишь оплата мощной модели не решает вопрос с доступом.
Из 34 успешных испытаний Anthropic также следует, что 16 завершились неудачей. Снятие блокировки позволяет попробовать выполнить задачу, но не гарантирует надёжность ответа.
Источник: https://www.anthropic.com/news/cyber-verification-program
Изображение: редакционная иллюстрация, созданная ИИ; это не объект Anthropic.