Parce que les limites de sécurité standard ne sont décrites qu’en anglais courant, il est étonnamment facile pour les utilisateurs d’amener une intelligence artificielle à abandonner ses propres consignes. Il suffit d’une question reformulée de manière astucieuse ou d’un peu de flatterie pour que ces protections écrites s’effondrent complètement.

Flow résout cette vulnérabilité en adoptant une approche entièrement différente. Au lieu de placer des restrictions dans une invite (prompt), les limites d’un agent sont solidement établies au niveau du compte. Bien que quelqu’un puisse peut-être manipuler des instructions écrites, il est absolument impossible de tromper un compte.