Các mô hình AI mã nguồn mở không hẳn là “cứu cánh giảm chi phí” mà mọi người vẫn nghĩ—và nếu bạn đang vận hành hạ tầng điện toán, điều này rất quan trọng.
Thị trường liên tục hoảng loạn rằng token rẻ hơn thì là tín hiệu xấu cho hạ tầng AI. Sai khung tư duy. Giá token không liên quan. Điều quan trọng là chi phí cho mỗi tác vụ được hoàn thành.
Hãy nghĩ như chuyện tuyển dụng: 3 người với mức lương 20k USD mỗi người so với 1 người lương 60k USD. Tổng chi phí như nhau. Nhân công rẻ nhưng cần gấp 3 lần số người thì thực ra không hề rẻ.
Logic tương tự áp dụng cho AI. Một mô hình có token cực rẻ nhưng lại “ngốn” gấp 3 lần token để hoàn thành một công việc? Không hề rẻ. Con số duy nhất quan trọng: chi phí cho mỗi tác vụ.
Bài kiểm tra thực tế từ 3F Research trên các tác vụ trợ lý nghiên cứu: Kimi K3, mô hình mã nguồn mở có token rẻ nhất, đắt hơn 29% cho mỗi tác vụ so với Opus 5 và đắt hơn 19% so với GPT-5.6. Nó kém hiệu quả theo token, lan man trước khi đưa ra câu trả lời, và bạn phải trả tiền cho từng bước.
“Chiêu” nằm ở đây: mô hình mã nguồn mở không làm giảm nhu cầu hạ tầng—chúng còn đang mở rộng nó. Đặc biệt là bộ nhớ. Mỗi phiên bản K3 cần khoảng 1,4 terabyte HBM để chạy. Mô hình “rẻ” này là một trong những triển khai tiêu tốn bộ nhớ nhất hiện nay.
Lần tới khi thị trường lại hoảng loạn vì một mô hình mã nguồn mở khác từ Trung Quốc, hãy “mua lúc giá giảm”. Đây là câu chuyện mở rộng cả bộ nhớ lẫn năng lực tính toán, chứ không phải câu chuyện phá hủy nhu cầu.
Thị trường liên tục hoảng loạn rằng token rẻ hơn thì là tín hiệu xấu cho hạ tầng AI. Sai khung tư duy. Giá token không liên quan. Điều quan trọng là chi phí cho mỗi tác vụ được hoàn thành.
Hãy nghĩ như chuyện tuyển dụng: 3 người với mức lương 20k USD mỗi người so với 1 người lương 60k USD. Tổng chi phí như nhau. Nhân công rẻ nhưng cần gấp 3 lần số người thì thực ra không hề rẻ.
Logic tương tự áp dụng cho AI. Một mô hình có token cực rẻ nhưng lại “ngốn” gấp 3 lần token để hoàn thành một công việc? Không hề rẻ. Con số duy nhất quan trọng: chi phí cho mỗi tác vụ.
Bài kiểm tra thực tế từ 3F Research trên các tác vụ trợ lý nghiên cứu: Kimi K3, mô hình mã nguồn mở có token rẻ nhất, đắt hơn 29% cho mỗi tác vụ so với Opus 5 và đắt hơn 19% so với GPT-5.6. Nó kém hiệu quả theo token, lan man trước khi đưa ra câu trả lời, và bạn phải trả tiền cho từng bước.
“Chiêu” nằm ở đây: mô hình mã nguồn mở không làm giảm nhu cầu hạ tầng—chúng còn đang mở rộng nó. Đặc biệt là bộ nhớ. Mỗi phiên bản K3 cần khoảng 1,4 terabyte HBM để chạy. Mô hình “rẻ” này là một trong những triển khai tiêu tốn bộ nhớ nhất hiện nay.
Lần tới khi thị trường lại hoảng loạn vì một mô hình mã nguồn mở khác từ Trung Quốc, hãy “mua lúc giá giảm”. Đây là câu chuyện mở rộng cả bộ nhớ lẫn năng lực tính toán, chứ không phải câu chuyện phá hủy nhu cầu.