Về cách Qwen3.8 đạt được sự “tiến hoá theo đơn vị ngày”, dựa trên các thông tin công khai hiện nay, cơ chế cốt lõi chủ yếu thể hiện ở ba khía cạnh: cập nhật tự động tần suất cao, kích hoạt động ở tầng nền tảng kiến trúc và cơ chế xác minh ban đêm cho kỹ năng của các tác nhân (Agent). Chi tiết như sau:

1. Trọng số tự động hoá tần suất cao và cập nhật liên kết (chain)
Qwen3.8 phá vỡ mô hình phát hành đơn lẻ quy mô lớn truyền thống, xây dựng một cơ chế lặp lại tự động tần suất cao. Đội ngũ cho biết, mô hình mỗi ngày vào lúc nửa đêm sẽ tự động cập nhật trọng số, cứ 48 giờ sẽ làm mới các tối ưu hoá của chuỗi suy luận (inference chain), và mỗi tuần sẽ đẩy lên các năng lực căn chỉnh đa phương thức (multi-modal alignment) hoàn toàn mới. Nhờ cơ chế này, việc nâng cấp mô hình trở thành một buổi “phát trực tiếp” liên tục.

2. Tuyến đường chuyên gia động và kiến trúc bộ nhớ đệm ghi nhớ theo tầng
Ở tầng kiến trúc nền, Qwen3.8 từ bỏ các “chiêu thức kích hoạt thưa” truyền thống, chuyển sang kiến trúc lai “tuyến đường chuyên gia động + bộ nhớ đệm ghi nhớ theo tầng”. Thiết kế này giúp 2,4T tham số có thể vận hành linh hoạt; thay vì “bỏ đống thành một con quái vật khổng lồ”, mô hình còn có thể “biết thở, biết phản tư, biết cân nhắc”. Các tối ưu hoá ở cấp kiến trúc này tạo cơ sở kỹ thuật cho việc lặp lại tần suất cao.

3. Cơ chế “tiến hoá và xác minh ban đêm” cho kỹ năng của tác nhân (Agent)
Ở cấp độ thực thi nhiệm vụ cụ thể của Agent, dòng Qwen (ví dụ Qwen3-Max) áp dụng “quy trình tiến hoá kỹ năng theo nhóm”. Cơ chế này biến các hội thoại tương tác thực tế của người dùng thành các bằng chứng có cấu trúc, do Evolver phân tích mẫu và tạo ra các bản cập nhật ứng viên (candidate updates). Các kỹ năng ứng viên này không được đưa lên trực tiếp mà sẽ đi vào “giai đoạn xác minh ban đêm”: trong môi trường thực tế, đồng thời thực thi kỹ năng cũ và kỹ năng ứng viên mới; chỉ khi kỹ năng mới thực sự vượt trội về tỷ lệ thành công tổng thể nhiệm vụ và độ ổn định khi thực thi so với kỹ năng cũ thì mới được chấp nhận và triển khai. Điều này đảm bảo “bể kỹ năng” đã triển khai không bị suy giảm theo thời gian, từ đó đạt được khả năng cải thiện hiệu năng ổn định liên tục.

4. Kiểm thử liên tục của phiên bản xem trước và hậu huấn luyện (post-training)
Hiện tại, mô hình phiên bản xem trước Qwen3.8-Max đang được cập nhật liên tục theo đơn vị “ngày”. Một số phân tích cho rằng việc cập nhật liên tục các phiên bản nhỏ của nền tảng tham số này cho thấy mô hình có thể đang trải qua quá trình hậu huấn luyện (Post-training) chuyên sâu, nhằm chuẩn bị cho việc phát hành phiên bản chính thức 4.0.