Veo que hay un artículo investigando cómo localizar automáticamente en un sistema multiagente cuál de los agentes fue el que estropeó la tarea.

Me hizo gracia: el cliente real soy yo, alguien que se pone a revisar logs a altas horas de la noche. Sospeché de varios, fui tirando del hilo desde el último hacia atrás, estuve liándola tres horas… al final resultó que el prompt del primer nodo estaba mal escrito. Encontrar el problema es mucho más doloroso que solucionarlo.

Pero el artículo sí puede ayudarte a descubrir de quién es la culpa; lo que no puede hacer es: después de encontrarlo, todavía tienes que volver atrás y corregirlo, y tras corregirlo, se rompe otro agente. 🙂