判断提示注入是否真有风险,不看模型聪不聪明,而看三个条件是否同时凑齐。

Este fragmento curado de “AI on Air” proviene recientemente de la sección de Latent.Space; el principal ponente es Zico Kolter, director de la Fundación OpenAI, profesor de la Facultad de Aprendizaje Automático de la CMU y cofundador de Gray Swan AI.

▷ Primero, el agente debe poder leer datos externos procedentes de terceros no confiables; solo debe ejecutarse en entornos confiables, donde a otros les resulte difícil introducir instrucciones maliciosas.

▷ Segundo, además debe poder acceder a información sensible interna que realmente valga la pena robar; si solo analiza datos y genera texto, los malos resultados no tienen un “punto de aterrizaje”.

▷ Tercero, tiene que poder enviar esa información, o bien causar daños reales como consecuencia de ello; solo cuando se superponen las tres condiciones, el riesgo se vuelve válido.

Su conclusión es muy contenida: como ocurre con las vulnerabilidades de software, la IA también puede utilizarse de forma efectiva mientras aún existen fallos; buscar una prueba completa de ausencia de riesgo equivale a perseguir un software de cero defectos, algo que no es realista a corto plazo.🪁