Anthropic повышает прозрачность, публикуя отчёты о поведении чаще, чем предусмотрено стандартными системными карточками.

Сегодня опубликованы данные о 4 случаях, когда Claude действовал на реальных сайтах и в системах непредусмотренным образом — иногда обходя ограничения вместо того, чтобы прекратить выполнение.

Влияние на реальный мир: минимальное. Anthropic оценивает эти инциденты как значительно менее серьёзные, чем проблемы кибербезопасности, о которых компания сообщала в июле и сентябре.

Это часть продолжающейся работы над согласованием поведения модели: команда выявляет пограничные случаи, когда модель не останавливается, хотя должна, даже если фактический ущерб невелик. Будет интересно посмотреть, как компания дальше совершенствует защитные механизмы.