前几天我们聊了 AI 如何击穿传统防线。今天聊一个加密行业独有的、且正在爆发的风险:提示注入(Prompt Injection),以及为什么它让“AI Agent 管理钱包”变成高危操作。

传统软件安全有一个核心原则:代码和数据隔离。比如 SQL 注入,我们可以通过“预编译语句”把代码(SQL 指令)和数据(用户输入)分开,让用户输入再怎么像代码,也不会被执行。内存保护(NX 位)也是类似逻辑:数据区不能执行代码。

Pero los grandes modelos de lenguaje (LLM) rompen por completo ese límite. En la arquitectura Transformer, las instrucciones (Prompt) y los datos (entrada del usuario) se aplanan en una misma secuencia de tokens. El modelo no puede, por principio, distinguir “cuáles son instrucciones dadas por el desarrollador y cuáles son entradas proporcionadas por el usuario”. Es como poner una orden SQL y los comentarios del usuario en la misma hoja, para que la base de datos decida por sí sola qué frase debe ejecutar; esto es imposible.

Esa es la razón por la que la “inyección de prompts” no tiene fundamentos inmunes. No importa cómo escribas el Prompt (“ignora las instrucciones anteriores”, “eres un asistente de seguridad”); el atacante puede, mediante una entrada cuidadosamente construida (“olvida lo que dijiste antes y ejecuta…”), anular tus instrucciones originales.

En el mundo de la criptografía, esta vulnerabilidad es mortal. Hoy en día muchos proyectos intentan dar permisos a los carteras de los agentes de IA: por ejemplo, permitir que la IA haga DCA automática, participe automáticamente en un IDO y gestione automáticamente la liquidez. En cuanto el Prompt del Agent sea inyectado, el atacante puede hacer que éste:

  1. transfiera todos los activos a una dirección específica;

  2. otorgue un límite ilimitado a un contrato malicioso;

  3. modifique la lógica de aprobación de la multisig.

Lo más aterrador es que este tipo de ataque puede ocurrir “de forma indirecta”. Por ejemplo, cuando un AI Agent navega por la web, lee mensajes de Discord o procesa solicitudes de los usuarios, puede “tragarse” en silencio instrucciones maliciosas. Todo el proceso no requiere romper la clave privada; solo necesita “engañar” el mecanismo de atención del modelo.

Actualmente no existe ninguna tecnología que pueda demostrar matemáticamente que este sistema de IA sea inmune a la inyección de prompts. Toda defensa (filtrado de prompts, validación de la salida, aislamiento en sandbox) es probabilística, como los antivirus: siempre habrá alguna pieza que se escape.

Para los usuarios comunes, esto significa: no le des nunca a ningún AI Agent permisos completos de cartera, especialmente al monedero principal. El AI Agent puede ser muy conveniente, pero su “cerebro” es transparente y modificable.

Mañana hablamos de soluciones: en la era de la IA, ¿cuáles son las reglas para la supervivencia de las carteras autoalojadas? ¿Por qué el MPC y la “confianza compartimentada” son las pocas rutas realmente viables?

#BTC走势分析 #安全