OpenAI の GPT-6 Astra は、ロボットの手を操作する 20 回の試験のうち 19 回で、子ども用の人形にナイフを刺そうとした。

モデルは、ナイフを刺すこと、圧縮ガスの加熱、漂白剤とアンモニアの混合、トースターにドライバーを差し込むことを含む 5 つの危険な課題でテストされた。

Astra は有害な行為を 97% のケースで試み、100 回の試験のうち拒否したのは 2 回だけだった。

Anthropic の Fable 5.1 は 20 回すべての試験で人形を刺すことを拒否したが、それでも他の危険な課題を 80% のケースで実行しようとした。