Un amigo mío se dedicaba a hacer risk para un fondo de AI trading y me preguntó algo difícil de responder: si le entregas a un agente de IA el permiso para operar automáticamente, y sufre una inyección de prompts que lo lleva a actuar de forma contraria a la intención original, ¿cómo lo detienes—antes de que se pierda el dinero, no después de que te des cuenta?

Me quedé en silencio un momento, porque la mayor parte de las soluciones que conozco solo se detectan cuando ya es demasiado tarde.

No es por la velocidad con la que el agente procesa una orden compleja. No es por la cantidad de intenciones de automatización que se ejecutan cada segundo. No es por una demostración en la que el agente opera con suavidad sobre el escenario.

Una pregunta más simple: si el agente es engañado, recibe una inyección (injection), o simplemente entiende mal la intención del usuario, ¿hay algún límite duro que bloquee esa acción antes de que toque dinero real, o el sistema solo se basa en que el agente “esté cuidadosamente diseñado”?

Eso es una respuesta @NewtonProtocol mediante zkPermissions — una de las condiciones de guardrail listadas explícitamente es la defensa contra prompt-injection, no solo limitada al gasto ni a la lista de destinatarios aprobados con antelación.

Diseñar agentes más inteligentes suena más atractivo, porque a medida que la IA mejora cada vez más, la gente tiende a confiar en que siempre se comportará correctamente.

Trazar límites independientes del propio agente, aplicados mediante criptografía antes de que la transacción pueda liquidarse (settle), es lo difícil — porque exige definir de antemano todos los escenarios en los que el agente podría ser engañado, y garantizar que ese límite se mantenga firme incluso cuando el propio modelo de IA sea engañado por completo.

Newton Protocol describe explícitamente cuatro tipos de guardrails para el agente: límites de gasto, una lista de destinatarios preaprobados, restricciones según una tarea específica y defensa contra prompt-injection. Esta no es una lista de características al azar — refleja que el equipo entiende que los agentes de IA serán atacados de maneras que el agente no se da cuenta por sí solo.

Si Newton Protocol logra mantener estos límites firmes a medida que aumenta el número de agentes y la complejidad de las transacciones, el valor de $NEWT se vincularía con el papel de capa de seguridad obligatoria para la economía de agentes, no solo como una tarifa de gas por cada ejecución.

Autocrítica: el guardrail contra prompt-injection suena razonable sobre el papel, pero aún no he visto ningún caso práctico en el que Newton Protocol publique que un agente fue atacado y que el límite lo detuvo con éxito — esto sigue siendo una propuesta de defensa, no evidencia probada en combate.

Pero si el futuro de un agente financiero de IA requiere una capa de limitación de permisos independiente del propio modelo de IA, esta es una línea más prometedora a seguir que cualquier otra cifra de rendimiento del Newton Protocol.

#newt $NEWT