Como os limites de segurança padrão são apenas descritos em inglês cotidiano, é surpreendentemente fácil para os usuários persuadirem uma inteligência artificial a abandonar suas próprias diretrizes. Tudo o que é preciso é uma pergunta habilmente reescrita ou um pouco de bajulação para que essas defesas escritas entrem em colapso completamente.

O Flow resolve essa vulnerabilidade com uma abordagem totalmente diferente. Em vez de colocar restrições dentro de um prompt, as limitações de um agente são estabelecidas firmemente no nível da conta. Embora alguém possa até manipular instruções escritas, é absolutamente impossível enganar uma conta.