Velvet Flash 0.1 vẽ ra một đường kẻ đáng giá: một mô hình biết nói về crypto chưa hẳn là mô hình có thể vận hành crypto.

@velvet_capital đang đánh giá liệu ý định của con người có thể trở thành hành động tài chính chính xác, đúng theo từng nền tảng hay không.

Bài test đưa cho một mô hình tài liệu kỹ năng của nền tảng đó cùng với một yêu cầu bằng ngôn ngữ tự nhiên. Mô hình phải chọn đúng lệnh, trích xuất chính xác số tiền, token, chain và địa chỉ, gắn cờ các yêu cầu rủi ro, và xác nhận trước khi tiền được chuyển đi. Đó là một công việc hoàn toàn khác so với việc chỉ đưa ra một câu trả lời nghe có vẻ thông minh.

Flash là một mô hình 4B. Trên bộ benchmark kỹ năng crypto nội bộ của Velvet, nó đạt 50 so với 23 của mô hình nền tảng, trong khi mức độ an toàn tăng từ 28 lên 61. Phần quan trọng không nằm ở bảng xếp hạng. Điều quan trọng là bộ benchmark trừng phạt gì: sai tham số, chuyển tiền không an toàn, định tuyến sai và không dừng lại khi yêu cầu không nên tiếp tục.

Bộ cốt lõi bao gồm Minara, Binance Spot, OKX DEX, Uniswap, GMX và MetaMask, với đánh giá mở rộng trên 31 nền tảng. Mỗi nền tảng có một “ngữ pháp vận hành” riêng. Vậy nên vấn đề sâu xa hơn là khả năng tương tác: liệu một yêu cầu từ một con người có thể “sống sót” qua quá trình dịch sang các lệnh, tham số và quy tắc an toàn khác nhau mà không làm mất ý nghĩa hay không?

Flash 0.1 vẫn là phiên bản đầu tiên, và đây là benchmark do chính Velvet xây dựng. Nó chưa chứng minh không có lỗi, khả năng sinh lợi hay sự hỗ trợ triển khai trên cả 31 nền tảng. Nhưng hướng đi còn lớn hơn một lần phát hành mô hình: AI tài chính trở nên hữu ích khi tôi hiểu đúng điều bạn muốn nói một cách đáng tin cậy biến thành “tôi biết chính xác thao tác bạn muốn”, và khi nào thì tôi không nên thực hiện nó.