Vì các ranh giới an toàn chuẩn chỉ được viết bằng tiếng Anh đời thường, nên thật bất ngờ là người dùng có thể dễ dàng thuyết phục một trí tuệ nhân tạo từ bỏ chính các nguyên tắc của nó. Chỉ cần một câu hỏi được diễn đạt khéo léo hoặc một chút lời khen ngợi là những lớp phòng thủ được viết ra có thể sụp đổ hoàn toàn.

Flow khắc phục lỗ hổng này bằng cách áp dụng một hướng tiếp cận hoàn toàn khác. Thay vì đặt các giới hạn trong một prompt, các giới hạn của một tác nhân được xác lập vững chắc ở cấp tài khoản. Dù ai đó có thể thao túng các hướng dẫn bằng văn bản, thì hoàn toàn không thể lừa dối một tài khoản.