標準的な安全境界は日常的な英語で書かれているだけなので、ユーザーが人工知能に自らのガイドラインを放棄させるのは意外と簡単です。必要なのは、巧みに言い換えた質問や、少しばかりのほめ言葉を用意することだけで、そうした書かれた防御が完全に崩れ落ちてしまいます。
Flowは、この脆弱性をまったく異なるアプローチで解決します。プロンプト内に制限を設けるのではなく、エージェントの制約をアカウント・レベルで確実に確立します。文章による指示を操作できたとしても、アカウントをだますことは絶対に不可能です。
Flowは、この脆弱性をまったく異なるアプローチで解決します。プロンプト内に制限を設けるのではなく、エージェントの制約をアカウント・レベルで確実に確立します。文章による指示を操作できたとしても、アカウントをだますことは絶対に不可能です。
