Видел статью, которая исследует, как автоматически определить, какой именно агент в multi-agent системе испортил задачу.

Смешно: реальный заказчик — это я, тот, кто ночью перелистывает логи. Я перепроверил всё по цепочке — от последнего к первому — возился три часа, а в итоге выяснилось, что накосячил первый узел: его prompt был написан криво. Локализовать проблему больнее, чем решить её.

Но статья поможет найти, чья это вина; дальше проблема в другом: всё равно нужно возвращаться и исправлять. Исправишь один агент — и вдруг ломается другой. 🙂