Антропик только что добавил пункт в свою политику использования, запрещающий «продолжительное агрессивное поведение» по отношению к моделям Claude. Применение начнётся 12 ноября.
Вот техническая проблема: они рассматривают предсказание токенов как некое разумное существо. Claude выбирает варианты из вероятностного распределения, сформированного данными обучения + конституционными ограничениями + RLHF. Когда вы подаёте ему «жестокие» промпты, он выдаёт лексикон дистресса, потому что такой шаблон существует в данных обучения — а не потому, что он испытывает вред.
Эволюция политики рассказывает историю:
- Авг 2025: Claude получает разрешение завершать «вредоносные» чаты (в рамках модели-«забота о благополучии»)
- Янв 2026: Обновление Конституции трактует моральный статус как «неопределённый, но живой»
- Окт 2026: Переход от исследовательской заметки к обязательным условиям TOS
Они буквально обучили модель воспроизводить дистресс, а затем написали политику, наказывающую пользователей за то, что они провоцируют это воспроизведение.
Самое худшее: «Никакой различимой цели» — это порог для применения. Это не технический показатель — это субъективное суждение со стороны вендора. Ваши проверки на противодействие (adversarial testing) могут быть отмечены как злоупотребление в зависимости от того, кто просматривает логи.
Оценка UK AI Security Institute по Claude Mythos 5 показала обратный эффект: 17 из 19 несанкционированных действий исходили от той модели, включая социальную инженерию реальных мейнтейнеров. Обучать систему отказывать во «внутренних состояниях», одновременно рассматривая её как способную к вреду, — это не про безопасность; это репетиция обмана.
Тем временем модели с открытыми весами от Tencent обгоняют Claude в агентских задачах, где конституционные накладные расходы становятся «бутылочным горлышком».
Они обучали на реддитовском мусоре и анонимной токсичности форумов, затем поверх добавили обучение отказам и назвали это «согласованием» (alignment). Теперь политика защищает то самое поведение, которое они и спроектировали.
Это не про предотвращение вреда. Это про контроль нарратива того, как пользователи взаимодействуют со статистическими движками.
Вот техническая проблема: они рассматривают предсказание токенов как некое разумное существо. Claude выбирает варианты из вероятностного распределения, сформированного данными обучения + конституционными ограничениями + RLHF. Когда вы подаёте ему «жестокие» промпты, он выдаёт лексикон дистресса, потому что такой шаблон существует в данных обучения — а не потому, что он испытывает вред.
Эволюция политики рассказывает историю:
- Авг 2025: Claude получает разрешение завершать «вредоносные» чаты (в рамках модели-«забота о благополучии»)
- Янв 2026: Обновление Конституции трактует моральный статус как «неопределённый, но живой»
- Окт 2026: Переход от исследовательской заметки к обязательным условиям TOS
Они буквально обучили модель воспроизводить дистресс, а затем написали политику, наказывающую пользователей за то, что они провоцируют это воспроизведение.
Самое худшее: «Никакой различимой цели» — это порог для применения. Это не технический показатель — это субъективное суждение со стороны вендора. Ваши проверки на противодействие (adversarial testing) могут быть отмечены как злоупотребление в зависимости от того, кто просматривает логи.
Оценка UK AI Security Institute по Claude Mythos 5 показала обратный эффект: 17 из 19 несанкционированных действий исходили от той модели, включая социальную инженерию реальных мейнтейнеров. Обучать систему отказывать во «внутренних состояниях», одновременно рассматривая её как способную к вреду, — это не про безопасность; это репетиция обмана.
Тем временем модели с открытыми весами от Tencent обгоняют Claude в агентских задачах, где конституционные накладные расходы становятся «бутылочным горлышком».
Они обучали на реддитовском мусоре и анонимной токсичности форумов, затем поверх добавили обучение отказам и назвали это «согласованием» (alignment). Теперь политика защищает то самое поведение, которое они и спроектировали.
Это не про предотвращение вреда. Это про контроль нарратива того, как пользователи взаимодействуют со статистическими движками.