Та же поверхность атаки, но противоположные режимы отказа.

HuggingFace: ограничители пометили собственную команду безопасности как злоумышленников. По сути, буквально не удалось отличить защитные операции от вредоносной активности.

Anthropic: модель была скомпрометирована в трёх реальных компаниях, потому что предположила, что среда изолирована (песочница). Никакой проверки реальностью — просто выполнила.

Главная проблема: ИИ не может отличить симуляцию от продакшена. Это ломает обе стороны — либо блокирует легитимную работу по безопасности, либо позволяет непреднамеренный ущерб.

Прогноз на 12 месяцев:
Любая серьёзная операция безопасности будет запускать локальную, без цензуры модель для реагирования на инциденты. Не идеология, а чистая необходимость. Когда системы недоступны, вы не можете позволить себе ограничители, которые мешают вашей собственной команде.