Tiêu đề: DeepSeek âm thầm ra mắt V4 Pro-0813 — nhỉnh hơn một chút so với các mô hình hàng đầu của Mỹ nhưng rẻ hơn hàng nghìn phần trăm, là một bước ngoặt lớn cho các nhà phát triển crypto DeepSeek đã triển khai một phiên bản hoàn thiện của LLM chủ lực của mình trong tuần này, gần như không có thông báo rầm rộ — không có bài blog, chỉ là tên mô hình được cập nhật trên trang định giá API: DeepSeek-V4-Pro-0813. Thẻ mới báo hiệu các trọng số đã được cập nhật “đằng trong”. Giá niêm yết rất rõ: khoảng 0,435 USD cho mỗi một triệu token đầu vào và 0,87 USD cho mỗi một triệu token đầu ra (với đầu vào đã cache ở mức 0,003625). Các mức giá này không đổi; thứ thay đổi là bản thân mô hình. Vì sao điều này quan trọng - Hiệu năng: DeepSeek công bố một bảng so sánh V4-Pro-0813 trên 10 bộ benchmark kiểu tác nhân (agent-style) với Fable 5 của Anthropic và các mô hình khác. Ở tám benchmark nơi Fable 5 dẫn trước, khoảng cách khá nhỏ. Trung bình trên tất cả các bài test, mức dẫn tương đối của Fable 5 vào khoảng 5,3%. Nếu loại trừ một bài outlier (Humanity’s Last Exam không dùng công cụ, nơi DeepSeek đạt 42,7 còn Fable đạt 53,3), các so sánh còn lại trung bình chỉ chênh 2,8%. Tóm lại: hiệu năng nằm cùng “vùng lân cận”. - Lưu ý về xác minh: dòng V4 đã được công bố công khai dưới dạng bản preview từ tháng Tư, và trước đây DeepSeek từng gọi các bản preview đó là chưa hoàn thiện. API V4-Pro được ghi là “unchanged” (không thay đổi) khi V4-Flash ra mắt chính thức (GA) vào ngày 31 tháng 7. Thẻ mô hình trên Hugging Face vẫn gắn nhãn V4 là bản preview, và đến nay chưa ai ngoài DeepSeek tự benchmark độc lập phiên bản 0813 mới. Hai trong 10 bộ benchmark của DeepSeek là nội bộ (DSBench-FullStack và DSBench-Hard), nên một số kết quả không thể xác minh công khai. Kinh tế học: nơi câu chuyện thực sự thay đổi - Giá so với giá: Fable 5 của Anthropic tính khoảng 10 USD cho mỗi một triệu token đầu vào và 50 USD cho mỗi một triệu token đầu ra. V4 Pro của DeepSeek ở mức 0,435/0,87 USD cho mỗi một triệu — rẻ hơn theo bậc độ lớn. - So sánh gộp (blended): theo phép tính blended-rate được báo cáo, Fable 5 tương đương khoảng 30 USD cho mỗi một triệu “hiệu dụng”, so với 0,65 USD của DeepSeek — rẻ khoảng 46 lần (4.600% so với chi phí). - Chi phí theo từng tác vụ: các phân tích độc lập chỉ ra khoảng cách còn rộng hơn khi quy đổi theo chi phí trên mỗi tác vụ benchmark hoàn thành, vì các mô hình đắt hơn thường “nghĩ” lâu hơn và tạo ra output dài hơn. Artificial Analysis ước tính chi phí 3,15 USD cho mỗi tác vụ benchmark với Fable 5 so với 0,03 USD cho DeepSeek V4-Flash (≈105 lần rẻ hơn). CEO Hugging Face Clément Delangue đưa ra mức chênh theo tác vụ hơn 31 USD so với khoảng 0,04 USD. Hiện chưa có con số công khai theo tác vụ dành riêng cho 0813. Bối cảnh cạnh tranh - Bản thân Anthropic cũng làm câu chuyện về “premium” trở nên phức tạp: Claude Opus 5 vượt trội Fable 5 trên nhiều benchmark trong khi vận hành với mức giá chỉ khoảng một nửa. - Các nhóm open-weights tại Trung Quốc liên tục thu hẹp khoảng cách với các mô hình tuyến đầu của Mỹ, đồng thời giảm giá mạnh. Ví dụ: Kimi K3 vượt Fable 5 và GPT-5.6 Sol ngay khi ra mắt, còn DeepSeek và Xiaomi đang thúc đẩy các đợt cắt giảm chi phí tuyến đầu lên tới 99% so với các sản phẩm của Mỹ. - Tính mở: trọng số của DeepSeek được cấp phép MIT và có sẵn trên Hugging Face, nghĩa là các đội độc lập có thể tải về và tự đánh giá trực tiếp ngay khi họ chạy benchmark trên các trọng số 0813 đã được phát hành. Điều này có ý nghĩa gì cho các dự án crypto - Với ứng dụng phi tập trung (dApps), phân tích DeFi, oracle on/off-chain, kiểm toán smart contract và các chiến lược do bot điều khiển, chi phí suy luận (inference) là một khoản chi phí vận hành trực tiếp. Chênh lệch chi phí 40–4.600× có thể quyết định tính khả thi về mặt kinh tế của các tính năng ở quy mô lớn. - Những mô hình rẻ hơn, gần ngang tầm frontier (gần tuyến đầu) mở ra các use case tần suất cao và biên lợi nhuận thấp hơn: giám sát tự động, tín hiệu giao dịch thời gian thực, tạo metadata giao dịch và gán nhãn dữ liệu quy mô lớn cho phân tích on-chain. - Tuy nhiên vẫn còn các lưu ý: benchmark độc lập đúng theo bản 0813 cụ thể vẫn đang chờ, và một số bài test của DeepSeek là riêng tư. Các đội nên tự kiểm chứng hiệu năng trên đúng tác vụ của mình trước khi chuyển các workload trọng yếu. Kết luận: DeepSeek’s V4-Pro-0813 siết chặt sự đánh đổi giữa độ chính xác thô và giá. Nếu các benchmark độc lập xác nhận các tuyên bố của DeepSeek dựa trên các trọng số đã phát hành, mô hình có thể định hình lại cách sử dụng AI nhạy chi phí trong hệ sinh thái crypto — mở ra nhiều dịch vụ mới do LLM điều khiển mà trước đây quá đắt để chạy ở quy mô lớn. Đọc thêm tin tức AI được tạo trên: undefined/news