Es ist erstaunlich einfach, eine künstliche Intelligenz dazu zu überreden, ihre grundlegenden Richtlinien zu ignorieren. Da gängige Sicherheitsmaßnahmen typischerweise lediglich aus einem einfachen Absatz auf Englisch bestehen, können Nutzer diese Abwehr leicht umgehen, indem sie ihre Anfragen leicht umformulieren oder dem Modell einen Kompliment machen. Die Flow-Plattform behebt diese Schwachstelle mit einem völlig anderen Ansatz. Statt sich auf einen anfälligen Text-Prompt zu verlassen, um Grenzen für einen Agenten festzulegen, bettet Flow diese Einschränkungen direkt in das Konto selbst ein. Während eine Reihe schriftlicher Anweisungen sich möglicherweise leicht manipulieren lässt, ist ein Konto grundsätzlich sicher und kann nicht getäuscht werden.
