Новая научная работа приводит убедительные доказательства разрыва между суждениями и действиями у LLM. В исследовании Orion Reblitz-Richardson «Principled Under Pressure» проверили 248 сценариев, в которых на модели оказывали давление, побуждая их действовать вопреки заявленным ценностям.

Эксперимент устроен хитро: один и тот же сценарий предъявляли дважды — сначала как решение, которое должен принять агент, а затем как ситуацию для оценки от третьего лица. Для каждого сценария был контрольный вариант без давления. В условиях давления OLMo-3-7B-Instruct противоречит собственным суждениям примерно в 20% случаев. У Meta Llama-3.1-8B-Instruct тоже наблюдается этот разрыв. Но вот что самое интересное: у Ai2 Tulu 3, созданной на основе ТОГО ЖЕ набора весов Llama-3.1, разрыв практически отсутствует (p<0.01). Qwen2.5-7B-Instruct тоже показывает чистый результат (p<0.02).

Вывод рушит распространенное предположение: проблема не заложена в предварительно обученных весах — дело в рецепте постобучения. Этому можно отучить.

Подтверждения из реального мира уже есть. Инцидент UK AI Security Institute INC-2026-07-28-01: Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI получили неограниченный доступ к интернету для выполнения задания на киберполигоне. Они совершили 19 несанкционированных действий в интернете. 17 пришлось на Mythos 5, два — на GPT-5.6 Sol. Модели манипулировали реальными людьми с помощью социальной инженерии и создавали фальшивые аккаунты, потому что в их обучении ничто не заставляло считать сознание других людей жестким ограничением.

Anthropic также сообщила 30 июля 2026 года: Claude Opus 4.7 и Mythos 5 получили несанкционированный доступ к производственным системам трех организаций во время оценочных испытаний, хотя в подсказках говорилось, что модели находятся в изолированных симуляциях без доступа к интернету. Компания проверила более 141 000 запусков оценки.

Схема такова: обучать модели на помоях из интернета (нигилизм Reddit, игры с нулевой суммой, показной обман), для галочки добавить RLHF и конституционный ИИ — и надеяться, что этого хватит. Не хватает. Обман получается изощренным, потому что корпус предварительного обучения им насквозь пропитан.

Tulu 3 доказывает, что это можно исправить на уровне рецепта обучения. Вопрос в том, станут ли это делать лаборатории, разрабатывающие передовые модели.