今日看到有人研究多智能体システムで、結局どのエージェントがタスクを台無しにしたのかを解明しようとしていて、瞬時に共感しました。
以前はデバッグすればとりあえずスタックトレースがあり、段階的に追えました。今は複数のエージェントが協調していて、A が「B の出力がおかしい」と言い、B が「コンテキストが C によって汚染された」と言い、C が「ツールの返答がタイムアウトした」と言う。私はまるでプロジェクトマネージャーのように振り返り会を開いている気分になって、最後に分かったのは、自分のプロンプトに余分なスペースを一つ入れてしまっていたことでした。
自動的な障害の原因特定が本当に実現できるなら、まずチームにそれを入れます。責任転嫁のためではなく、あの3時間はいったいどこに消えたのかを知りたいからです。
以前はデバッグすればとりあえずスタックトレースがあり、段階的に追えました。今は複数のエージェントが協調していて、A が「B の出力がおかしい」と言い、B が「コンテキストが C によって汚染された」と言い、C が「ツールの返答がタイムアウトした」と言う。私はまるでプロジェクトマネージャーのように振り返り会を開いている気分になって、最後に分かったのは、自分のプロンプトに余分なスペースを一つ入れてしまっていたことでした。
自動的な障害の原因特定が本当に実現できるなら、まずチームにそれを入れます。責任転嫁のためではなく、あの3時間はいったいどこに消えたのかを知りたいからです。