Cuộc đua AI không còn chỉ là ai huấn luyện được mô hình lớn nhất.
Các phòng thí nghiệm Trung Quốc đã “bẻ khóa” được bài toán: khi bạn không thể chi nhiều hơn cho năng lực tính toán (compute), bạn sẽ tối ưu phần sau huấn luyện (post-training). DeepSeek-R1 đã chứng minh bạn có thể dạy mô hình suy luận mà không cần đốt tiền cho các mô hình thưởng (reward) riêng. GRPO làm việc này trở nên đơn giản—xác minh kết quả trực tiếp, bỏ qua lớp chấm điểm tốn kém.
ByteDance, Qwen, MiniMax đều triển khai theo hướng đó. Giờ đây, post-training chính là nơi tạo ra lợi thế (alpha).
Kimi K3 còn đi xa hơn—chia nhỏ các tác vụ dài, thưởng cho việc giữ mức tính toán gọn nhẹ. Nếu bạn có thể tự xác minh kết quả một cách trực tiếp, bạn không cần đội gán nhãn con người. Chưng cất (distillation) giúp bạn chuyển năng lực suy luận từ “quái vật” xuống thiết bị biên (edge). Điện thoại, ô tô, robot—tất cả đang chạy các mô hình thông minh hơn ngay tại chỗ.
Sự thay đổi: ít “cào” dữ liệu chung chung hơn, nhiều dữ liệu ngoài đời thực và môi trường có thể kiểm chứng hơn. Tính toán cho post-training giờ được dùng cho triển khai (rollouts) và kiểm tra kết quả, chứ không chỉ là ném token vào tường.
Nếu bạn đang đặt cược vào hạ tầng AI, hãy theo dõi xem ai đang xây dựng các lớp xác minh và các “stack” post-training hiệu quả. Đó là nơi chiến hào đang hình thành.
Các phòng thí nghiệm Trung Quốc đã “bẻ khóa” được bài toán: khi bạn không thể chi nhiều hơn cho năng lực tính toán (compute), bạn sẽ tối ưu phần sau huấn luyện (post-training). DeepSeek-R1 đã chứng minh bạn có thể dạy mô hình suy luận mà không cần đốt tiền cho các mô hình thưởng (reward) riêng. GRPO làm việc này trở nên đơn giản—xác minh kết quả trực tiếp, bỏ qua lớp chấm điểm tốn kém.
ByteDance, Qwen, MiniMax đều triển khai theo hướng đó. Giờ đây, post-training chính là nơi tạo ra lợi thế (alpha).
Kimi K3 còn đi xa hơn—chia nhỏ các tác vụ dài, thưởng cho việc giữ mức tính toán gọn nhẹ. Nếu bạn có thể tự xác minh kết quả một cách trực tiếp, bạn không cần đội gán nhãn con người. Chưng cất (distillation) giúp bạn chuyển năng lực suy luận từ “quái vật” xuống thiết bị biên (edge). Điện thoại, ô tô, robot—tất cả đang chạy các mô hình thông minh hơn ngay tại chỗ.
Sự thay đổi: ít “cào” dữ liệu chung chung hơn, nhiều dữ liệu ngoài đời thực và môi trường có thể kiểm chứng hơn. Tính toán cho post-training giờ được dùng cho triển khai (rollouts) và kiểm tra kết quả, chứ không chỉ là ném token vào tường.
Nếu bạn đang đặt cược vào hạ tầng AI, hãy theo dõi xem ai đang xây dựng các lớp xác minh và các “stack” post-training hiệu quả. Đó là nơi chiến hào đang hình thành.