Một người bạn làm risk cho quỹ AI trading từng hỏi mình một câu khó trả lời: nếu bạn giao cho AI agent quyền tự động trade, và nó bị prompt injection khiến hành động sai ý định ban đầu, bạn dừng nó lại bằng cách nào — trước khi tiền mất, không phải sau khi phát hiện ra?
Mình im lặng một lúc, vì phần lớn giải pháp mình biết đều chỉ phát hiện sau khi đã muộn.
Không phải từ tốc độ agent xử lý một lệnh phức tạp. Không phải từ số lượng automation intent chạy mỗi giây. Không phải từ demo agent giao dịch mượt mà trên sân khấu.
Câu hỏi đơn giản hơn — nếu agent bị đánh lừa, bị injection, hay chỉ đơn giản là hiểu sai ý định người dùng, có ranh giới cứng nào chặn hành động đó lại trước khi nó chạm vào tiền thật, hay hệ thống chỉ dựa vào việc agent “được thiết kế cẩn thận”?
Đó là câu @NewtonProtocol trả lời bằng zkPermissions — một trong các điều kiện guardrail được liệt kê rõ là phòng thủ trước prompt-injection, không chỉ giới hạn chi tiêu hay danh sách người nhận được duyệt trước.
Thiết kế agent thông minh hơn thì dễ nghe hấp dẫn, vì AI ngày càng giỏi khiến người ta dễ tin tưởng nó sẽ luôn hành xử đúng.
Xây ranh giới độc lập với chính agent, được thực thi bằng mật mã trước khi giao dịch được phép settle, mới khó — vì nó đòi hỏi định nghĩa trước mọi kịch bản agent có thể bị lừa, và đảm bảo ranh giới đó đứng vững ngay cả khi bản thân mô hình AI bị đánh lừa hoàn toàn.
Newton Protocol liệt kê rõ bốn loại guardrail cho agent: giới hạn chi tiêu, danh sách người nhận được duyệt trước, ràng buộc theo nhiệm vụ cụ thể, và phòng thủ prompt-injection. Đây không phải danh sách tính năng ngẫu nhiên — nó phản ánh việc đội ngũ hiểu rằng agent AI sẽ bị tấn công theo những cách mà agent không tự nhận ra.
Nếu Newton Protocol giữ được các ranh giới này vững khi số lượng agent và độ phức tạp giao dịch tăng lên, giá trị của $NEWT sẽ gắn với vai trò lớp an toàn bắt buộc cho nền kinh tế agent, không chỉ là phí gas cho mỗi lần thực thi.
Tự phản biện: guardrail chống prompt-injection nghe hợp lý trên giấy, nhưng mình chưa thấy case thực tế nào Newton Protocol công khai một agent đã bị tấn công và ranh giới đã chặn đứng thành công — đây vẫn là thiết kế phòng thủ, chưa phải bằng chứng đã qua thử lửa.
Nhưng nếu tương lai của AI agent tài chính cần một lớp giới hạn quyền hạn độc lập với chính mô hình AI, thì đây là hướng đáng theo dõi hơn bất kỳ con số hiệu năng nào khác của Newton Protocol.
