Da Standard-Sicherheitsgrenzen nur in alltäglichem Englisch formuliert sind, ist es überraschend einfach, dass Nutzer eine künstliche Intelligenz dazu überreden, ihre eigenen Richtlinien aufzugeben. Alles, was es braucht, ist eine geschickt umformulierte Frage oder ein wenig Schmeichelei, damit diese schriftlich verankerten Abwehrmechanismen vollständig zusammenbrechen.
Flow behebt diese Schwachstelle, indem es einen völlig anderen Ansatz verfolgt. Anstatt Einschränkungen in einen Prompt zu schreiben, werden die Grenzen eines Agents klar auf Kontoebene festgelegt. Während jemand möglicherweise geschriebene Anweisungen manipulieren kann, ist es absolut unmöglich, ein Konto zu täuschen.
Flow behebt diese Schwachstelle, indem es einen völlig anderen Ansatz verfolgt. Anstatt Einschränkungen in einen Prompt zu schreiben, werden die Grenzen eines Agents klar auf Kontoebene festgelegt. Während jemand möglicherweise geschriebene Anweisungen manipulieren kann, ist es absolut unmöglich, ein Konto zu täuschen.
