Anthropic または OpenAI のコーディングエージェントのいずれかを、実際のリポジトリで数時間動かしてみると、返ってくるのはチャットのやり取り(トランスクリプト)だけです。しかし、それが実際にディスク上で何をどう変えたのかについてはほとんど分かりません。

両ラボとも、これらのエージェントが自律的にどれだけ長く動けるかを強く推していますが、実際にその後に「何をしたのか」を再構築するための対応手段を、同等の形で提供していません。実行の様子をライブで最後まで見たとしても、それから1日経った後に、どの編集がプロダクションを壊したのかを言い当てられないことがあります。