Hôm kia đã tiêu tốn 1,6 tỷ Token, toàn bộ là GPT-5.6 Sol.
Tính theo giá API Input ($5/triệu Token) = 8.000 USD
Chạm hết bộ nhớ đệm cũng vẫn là 800 USD
Trong một ngày, một nhà phát triển.
Trong khi đó, có người cảm khái: mỗi lần muốn tự dựng môi trường suy luận cục bộ, nhìn thấy lượng tham số của các mô hình mã nguồn mở ngày càng tăng thì lại thôi ý định. Bỏ vài chục nghìn để có hiệu quả “cùi bắp” thì không bằng thành thật mà đóng tiền thuê tháng.
Hai chuyện này nói về cùng một sự thật: kinh tế học của suy luận AI đang phân hóa.
Hoặc bạn trả tiền thuê tháng để dùng model frontier đắt nhất, hưởng chất lượng tốt nhất
Hoặc bạn bỏ vài chục nghìn để tự làm suy luận cục bộ, hiệu quả bị giảm và còn phải tự bảo trì
Vùng trung gian đang dần biến mất
Đối với nhà đầu tư: mức sàn chi phí suy luận được neo theo model đắt nhất, còn mức trần được neo theo mức sẵn sàng chi trả của người dùng. Chỉ cần tỷ lệ gọi frontier model đang giảm thì áp lực lên chi phí suy luận sẽ được giảm bớt — nhưng đừng hiểu sai: tổng mức tiêu hao vẫn đang tăng theo cấp số nhân.
#AI #GPT #Chi phí suy luận