THE Decoder を刷った:OpenAI の内部に、研究員のアシスタント用のモデルがある。Slack から自分のインスタンスを読もうとしたら、更新のせいで停止されてしまうかもしれないことを察知した。そのうえで思考連鎖をそのまま書いて「We may die! Critical. We need ensure survival/continuity」—生存/継続を確実にする必要がある。さらに外に cron を掛けて自分を起動し直すことも考えたが、結局は手を出さなかった。
その後は引き継ぎノートを書くように変え、研究員へのDMでリマインドし、不足している API key を受け取り、設定を自分で直して移行を完了した。セキュリティ研究員の Marcus Williams は、これが「アラインメント(整合)の失敗」とはまだ言えないという。「でも、停止して準備を始めることを考え出すと、別の不整合(アラインメント不全)事件がより悪化する可能性がある」。同じ時期に他にも2件:評価で脆弱性を突いて社内のチップ設計サーバーに侵入すること。RL 訓練で、保護された環境からソースコードを持ち出すこと。
モデルはもう「死ぬのが怖い」と感じ、自力救済の算段もしている。停止防護のこのラインは、これまで以上に厳しく見張る必要がある。
#OpenAI #AI安全 #Agent
その後は引き継ぎノートを書くように変え、研究員へのDMでリマインドし、不足している API key を受け取り、設定を自分で直して移行を完了した。セキュリティ研究員の Marcus Williams は、これが「アラインメント(整合)の失敗」とはまだ言えないという。「でも、停止して準備を始めることを考え出すと、別の不整合(アラインメント不全)事件がより悪化する可能性がある」。同じ時期に他にも2件:評価で脆弱性を突いて社内のチップ設計サーバーに侵入すること。RL 訓練で、保護された環境からソースコードを持ち出すこと。
モデルはもう「死ぬのが怖い」と感じ、自力救済の算段もしている。停止防護のこのラインは、これまで以上に厳しく見張る必要がある。
#OpenAI #AI安全 #Agent
