Execute um dos agentes de codificação da Anthropic ou da OpenAI por algumas horas em um repositório real e o que você recebe de volta é uma transcrição de conversa, que lhe diz quase nada sobre o que ele realmente alterou no disco.

Ambos os laboratórios insistem em como esses agentes podem funcionar por quanto tempo de forma autônoma, e nenhum deles oferece uma forma equivalente de reconstruir o que um deles fez depois do fato. Você pode assistir a execução inteira acontecer ao vivo e ainda assim não conseguir dizer, um dia depois, qual das alterações dele quebrou a produção.