Um amigo meu que trabalha com risco para um fundo de AI trading me perguntou uma questão difícil de responder: se você der a um agente de IA a permissão para fazer trade automaticamente, e ele for induzido por prompt injection a agir de modo contrário ao que você pretendia, como você o interrompe — antes que o dinheiro seja perdido, e não depois que você descobre?
Fiquei em silêncio por um tempo, porque a maior parte das soluções que eu conhecia só eram identificadas depois que já era tarde.
Não é pela velocidade com que o agente processa uma ordem complexa. Não é pelo número de intenções de automação executadas a cada segundo. Não é pelos demos de um agente negociando de forma perfeita no palco.
Pergunta mais simples — se o agente for enganado, sofrer injection, ou simplesmente entender mal a intenção do usuário, existe algum limite rígido para bloquear essa ação antes que ele chegue a dinheiro de verdade, ou o sistema depende apenas de que o agente “foi cuidadosamente projetado”?
Isso é uma frase @NewtonProtocol respondida por zkPermissions — uma das condições de guardrail listadas de forma explícita é a defesa contra prompt-injection, não se limitando apenas a gastos ou a listas de destinatários aprovados antes.
Projetar agentes mais inteligentes é algo que soa mais atraente, porque, conforme a IA fica cada vez melhor, as pessoas acabam acreditando que ela sempre vai se comportar corretamente.
Traçar limites independentes do próprio agente, aplicados por criptografia antes que uma transação seja permitida liquidar, é o que realmente torna difícil — porque exige definir com antecedência todos os cenários em que o agente pode ser enganado, e garantir que esses limites permaneçam firmes mesmo quando o próprio modelo de IA é completamente enganado.
O Newton Protocol lista claramente quatro tipos de guardrail para agentes: limites de gastos, listas de destinatários previamente aprovados, restrições conforme a tarefa específica e defesa contra prompt-injection. Não é uma lista aleatória de recursos — ela reflete o fato de que a equipe entende que agentes de IA serão atacados de maneiras que o próprio agente não reconhece.
Se o Newton Protocol conseguir manter esses limites firmes enquanto o número de agentes e a complexidade das transações aumentam, o valor de $NEWT estará ligado ao papel de uma camada de segurança obrigatória para a economia de agentes, não apenas como taxa de gas para cada execução.
Auto-reflexão: o guardrail contra prompt-injection faz sentido em teoria, mas eu ainda não vi nenhum caso prático em que o Newton Protocol tenha publicado um agente que foi atacado e no qual o limite impediu com sucesso — ainda é um design defensivo, não uma evidência testada e comprovada.
Mas, se o futuro de agentes financeiros de IA precisar de uma camada de limitação de permissões independente do próprio modelo de IA, então esta é uma direção que vale mais a pena acompanhar do que quaisquer outros números de desempenho do Newton Protocol.
