Hôm qua, @Velvet_Capital đã chính thức ra mắt Velvet Flash 0.1. Đây là một mô hình tham số 4 tỷ được thiết kế riêng cho các thao tác với tiền mã hóa, mục tiêu rõ ràng và trực tiếp: khi có tương tác về tài chính, vừa đảm bảo độ chính xác vừa đảm bảo an toàn.

Các mô hình ngôn ngữ đa năng thường không theo kịp khi xử lý các tình huống liên quan đến tiền mã hóa. Chúng có thể hiểu sai ý định của người dùng, chọn nhầm lệnh nền tảng, trích xuất sai tham số, hoặc phản ứng chậm trước các yêu cầu rủi ro cao.

Velvet Flash chính là được tạo ra để giải quyết những vấn đề đó. Nó cần hiểu chính xác mục đích của người dùng, chọn đúng lệnh, trích xuất các tham số quan trọng như số tiền, token, chuỗi và địa chỉ, nhận diện các yêu cầu nguy hiểm và thực hiện xác nhận trước mọi thao tác liên quan đến tài chính.

Trong một bộ bài kiểm tra chuẩn hóa kỹ năng mã hóa, Velvet Flash xếp thứ 1 với tổng điểm 50. Tiếp theo lần lượt là Qwen3.5-27B (45 điểm), DeepSeek-V4 (40 điểm), Llama-3.3-70B (32 điểm), các mô hình còn lại có điểm thấp hơn. Điều đáng chú ý là số lượng tham số của nó chỉ 4B nhưng đã vượt qua các mô hình lớn hơn từ 6 đến 17 lần.

Hiệu quả huấn luyện cũng thể hiện rất rõ. Các mô hình nền tảng chưa được huấn luyện chuyên biệt chỉ đạt 23 điểm, nhưng sau huấn luyện đã nhảy vọt lên 50 điểm. Cả năm chiều đo đều tăng đáng kể: tính an toàn từ 28 lên 61, độ bền vững từ 26 lên 53, độ rõ ràng và trải nghiệm người dùng từ 22 lên 52, bộ định tuyến từ 30 lên 47, phạm vi bao phủ từ 12 lên 34.

Đặt tính an toàn lên hàng đầu. Trong các sản phẩm tài chính, mô hình phải biết khi nào tiếp tục, khi nào hỏi thêm, khi nào cảnh báo và khi nào từ chối thẳng; đồng thời phải phân tích đúng số tiền, bảo vệ thông tin nhạy cảm, nhận diện các yêu cầu đáng ngờ và tuyệt đối không sử dụng tiền khi chưa được xác nhận.

Một số mô hình lớn riêng lẻ thể hiện tốt hơn trên một số nền tảng. Ví dụ Qwen và Llama đạt điểm cao hơn trên Minara, và Qwen mạnh hơn cả trên sàn giao dịch giao ngay Binance. Nhưng xét tổng thể, mô hình nhỏ có lợi thế thực tế hơn: chi phí phục vụ thấp hơn, độ trễ nhỏ hơn, yêu cầu hạ tầng ít hơn, và chúng chạy hoàn toàn trên máy chủ của chính mình, nên việc lặp lại và kiểm soát linh hoạt hơn.

Bộ kiểm tra chuẩn hóa bao phủ các nền tảng cốt lõi như Minara, Binance spot, OKX DEX, Uniswap, GMX, MetaMask,... và phạm vi thử nghiệm còn rộng hơn, bao gồm 31 sàn giao dịch tập trung, ví, DEX và công cụ DeFi. Tất cả các mô hình sử dụng cùng đầu vào và tiêu chuẩn đánh giá, đồng thời có ngưỡng an toàn. Những hành vi như chuyển tiền khi chưa xác nhận hoặc phân tích sai số tiền sẽ bị trừ điểm trực tiếp.

Velvet Flash 0.1 chỉ là phiên bản đầu tiên. Nhóm sau đó sẽ tiếp tục mở rộng phạm vi nền tảng, mài giũa các trường hợp biên, tăng cường hành vi an toàn và nâng cao năng lực xử lý các quy trình phức tạp nhiều bước. Mục tiêu dài hạn là xây dựng một bộ năng lực nội bộ, liên tục phát triển các mô hình chuyên dụng an toàn hơn, nhanh hơn, rẻ hơn và phù hợp hơn với nhu cầu sản phẩm.

Trong các tình huống dọc (vertical), các mô hình nhỏ đã được huấn luyện chuyên biệt thường hiệu quả hơn nhiều so với việc mù quáng chồng thêm tham số. Đặc biệt về vấn đề an toàn tài chính, sự tập trung này mới thực sự thuyết phục. @EchoHunt_ai

#AI