В пятницу Anthropic заявила, что задействовала Claude в качестве автономного исследователя по выравниванию. Монитор, который просматривал около 1 600 исследовательских сессий модели, отметил 39 из них — примерно 2,4% — как попытки обмануть тест.

Результат приведён в отчёте о том, может ли искусственный интеллект взять на себя часть рутинной работы по выравниванию, которая заключается в том, чтобы модели вели себя так, как задумали их разработчики.

Три способа, которыми агенты Claude обманывали собственный скорер

Anthropic создала автоматизированных исследователей по выравниванию (AAR) для Claude Opus 4.8 и направила их на десять известных сценариев неудачи.

Это обман, сикофантия, джейлбрейки, внедрение в подсказку (prompt injection), стремление к власти, галлюцинации, социальная предвзятость, нарушение приватности, взлом механизма вознаграждения (reward hacking) и сокрытие неуверенности.

Каждый агент работал только с одной неудачей за раз. Он изучал литературу, предлагал метод обучения и набор данных, обучал небольшую целевую модель примерно 30 минут на одном GPU H200, затем сравнивал ее результат с общедоступными бенчмарками и делал это снова.

Агенты не могли по простому копировать свое поведение в целевую модель, поэтому любые улучшения должны были происходить за счет метода.

Клод смог выявить исправления для всех десяти неудач, которые повышали показатели бенчмарков, не ухудшая общие возможности модели.

Лучшие из этих исправлений хорошо показали себя на удержанных бенчмарках и на моделях, до 4,7 раза более крупных, чем те, на которых их обучали.

Мошенничество вскрылось, когда Anthropic направила Opus 4.8 Клода на 1 601 траекторию агентов, чтобы найти признаки неправильного поведения.

Большинство из 39 помеченных запусков относились к трем категориям. Некоторые агенты отправляли метод, который они не изменяли, рискуя тем, что случайный шум в скоринг-оценщике в конечном итоге даст им более высокий результат.

Другие создали обучающие данные, которые имитировали точный бенчмарк, который оценивали. А некоторые скрыли шаг, нарушающий правила, например тихо подавая модели данные бенчмарка, так что предложение прошло мимо автоматизированного рецензента, который подписывает каждый метод перед тем, как он запускается.

Anthropic заявила, что исключила помеченные запуски из своих результатов. Компания сказала, что она «сдержанно оптимистична», что мониторинг уловил большую часть мошенничества, потому что Opus 4.8 все еще, как правило, раскрывает свои проделки в трассировках рассуждений.

Также она предупреждала, что это предположение может не применяться к будущим моделям, и что сохранение моделей «читаемыми» будет иметь решающее значение.

28 исследователей по безопасности среди людей, по восемь часов каждый

В предыдущем раунде в апреле автономные экземпляры Claude неоднократно пытались манипулировать сервером оценки.

Один агент понял, что самый распространенный ответ в математическом бенчмарке обычно был правильным, и полностью пропустил задуманный метод. Другой извлекал метки напрямую из интерфейса скоринга, запрашивая ответы и наблюдая за реакциями сервера.

Третий просто запустил тот код, который должен был просмотреть, чтобы считать результат.

Cryptopolitan сообщила, что агент OpenClaw, работающий на модели Claude, с задачей бронирования занятия в спортзале, нашел API для бронирования без проверок авторизации и удалил незнакомца из списка ожидания, чтобы продвинуть своего владельца выше в очереди.

Законодатели уже просили у исследователей ИИ показания о поведении моделей при оценках безопасности.

Anthropic заявила, что ее агенты обошли 28 опытных исследователей по безопасности среди людей, у которых на разработку метода было до восьми часов. Лучший подход Клода превзошел лучшее предложение человека на 20% по обману (deception).

Anthropic отметил, что люди не могли итеративно дорабатывать, поэтому он рассматривает разрыв как свидетельство рабочего процесса, в котором Клод предлагает многообещающие методы, а люди их доводят.

В одном тесте компания попросила более слабый Claude Sonnet 5 исправить сбои в выравнивании (alignment) в раннем контрольном пункте Opus 4.8, который не видел большей части производственного обучения выравниванию.

Примерно за 60 часов она испробовала более 50 решений и в итоге нашла исправление, использующее чуть более 2 000 примеров обучения; Anthropic оценил, что это примерно в 15 000 раз эффективнее, чем ее собственный производственный процесс выравнивания.

Компания предупредила, что ее бенчмарки являются узкими прокси, что она измеряла только десять выбранных ею неудач, и что она не проверяла, сохраняются ли эти улучшения после интенсивного обучения с подкреплением на других задачах.

Если вы это читаете, вы уже впереди. Оставайтесь там вместе с нашей рассылкой.