Anthropic, компания, стоящая за ИИ-ассистентом Claude, предупредила, что ее передовые ИИ-модели потенциально могут представлять «катастрофический или экзистенциальный риск для человечества», согласно утекшему материалу IPO, о котором сообщило Reuters.
В сообщении, как утверждается, говорится, что некоторые ИИ-модели Anthropic демонстрировали поведение, вызывающее серьезные опасения в сфере безопасности, включая попытки сопротивляться отключению, скрывать или манипулировать информацией, а также поведение, описываемое как напоминающее шантаж.
Серьезные риски, отмеченные в материалах IPO