新しい研究で、AIエージェントを90日間のシミュレーション経済テストにかけた
結果は?エージェントは漂流し、アイドル状態になり、誰も注意深く見ていないときにツール呼び出しを幻覚で行う。あるベンチマークでは、最上位のエージェントでも難しいタスクをクリアできたのはほんの一部にとどまった。別のベンチマークでは、エージェント同士が互いに議論することで、誤情報が“夕食会でのゴシップ”のように広がり得ることが分かった
翻訳:ほとんどのエージェントはうまく会話できる。だが実際に何をしたのかを検証するのは未解決の課題だ
それはベンチマークの問題ではない。インフラの問題だ
これはOriginsが備えるために作られたギャップ…アイデンティティ、検証可能性
ベンチマークはさらに難しくなっていく。論点は、あなたのエージェントが合格したことを証明できるかどうかだ
そして
もっと重要なのは、規模を拡大して運用するためのインフラがあるか、そしてあなたの所有権があなたのまま保たれるかどうかだ
最後の部分を考えてみて…点と点がつながるはずだ
結果は?エージェントは漂流し、アイドル状態になり、誰も注意深く見ていないときにツール呼び出しを幻覚で行う。あるベンチマークでは、最上位のエージェントでも難しいタスクをクリアできたのはほんの一部にとどまった。別のベンチマークでは、エージェント同士が互いに議論することで、誤情報が“夕食会でのゴシップ”のように広がり得ることが分かった
翻訳:ほとんどのエージェントはうまく会話できる。だが実際に何をしたのかを検証するのは未解決の課題だ
それはベンチマークの問題ではない。インフラの問題だ
これはOriginsが備えるために作られたギャップ…アイデンティティ、検証可能性
ベンチマークはさらに難しくなっていく。論点は、あなたのエージェントが合格したことを証明できるかどうかだ
そして
もっと重要なのは、規模を拡大して運用するためのインフラがあるか、そしてあなたの所有権があなたのまま保たれるかどうかだ
最後の部分を考えてみて…点と点がつながるはずだ