Faites tourner l’un des agents de codage d’Anthropic ou d’OpenAI pendant quelques heures sur un vrai dépôt, et ce que vous récupérez, c’est une transcription de conversation, qui ne vous apprend presque rien sur ce qu’il a réellement modifié sur le disque.
Les deux équipes insistent sur la durée pendant laquelle ces agents peuvent fonctionner de façon autonome, et aucune ne propose une méthode équivalente pour reconstituer ce que l’un d’entre eux a fait après coup. Vous pouvez observer l’exécution en direct et, pourtant, être incapable de dire, un jour plus tard, lequel de ses changements a cassé la production.
Les deux équipes insistent sur la durée pendant laquelle ces agents peuvent fonctionner de façon autonome, et aucune ne propose une méthode équivalente pour reconstituer ce que l’un d’entre eux a fait après coup. Vous pouvez observer l’exécution en direct et, pourtant, être incapable de dire, un jour plus tard, lequel de ses changements a cassé la production.
