Tentang bagaimana Qwen 3.8 mewujudkan evolusi “berbasis hari”, berdasarkan informasi publik yang ada, mekanisme intinya terutama tercermin dalam tiga aspek: pembaruan otomatis berfrekuensi tinggi, aktivasi dinamis di lapisan arsitektur, serta verifikasi kemampuan agen (Agent) pada malam hari. Detailnya sebagai berikut:
1. Bobot dan pembaruan jalur (link) otomatis berfrekuensi tinggi
Qwen 3.8 memecah pola tradisional dengan rilis besar sekali jalan, dan membangun mekanisme iterasi otomatis berfrekuensi tinggi. Tim mengungkapkan bahwa model akan otomatis memperbarui bobot setiap dini hari, menyegarkan optimasi jalur inferensi setiap 48 jam, dan mendorong kemampuan penyelarasan multimodal yang benar-benar baru setiap minggu. Mekanisme ini membuat peningkatan model berubah menjadi sebuah acara “siaran langsung” yang berlangsung terus-menerus.
2. Routing ahli dinamis dan arsitektur cache memori bertingkat
Pada tingkat arsitektur, Qwen 3.8 meninggalkan trik aktivasi jarang (sparse) tradisional, dan mengadopsi arsitektur hibrida berupa “dynamic expert routing + hierarchical memory cache”. Desain ini membuat 2,4T parameter dapat bekerja secara dinamis; saat berjalan, model “bukan dibangun jadi monster raksasa yang ditumpuk, melainkan adalah agen cerdas yang bisa bernapas, bisa merefleksikan, dan tahu kapan harus memilih.” Optimasi arsitektural inilah yang menjadi fondasi teknis bagi iterasi berfrekuensi tinggi.
3. Mekanisme “evolusi dan verifikasi pada malam hari” untuk kemampuan Agen (Agent)
Pada level eksekusi tugas Agent yang spesifik, seri Qwen (misalnya Qwen3-Max) menerapkan “alur evolusi keterampilan kolektif”. Mekanisme ini mengubah sesi interaksi nyata pengguna menjadi bukti yang terstruktur, lalu Evolver menganalisis pola dan menghasilkan pembaruan kandidat. Keterampilan kandidat ini tidak langsung ditayangkan, melainkan masuk ke “tahap verifikasi pada malam hari”: di lingkungan nyata, keterampilan lama dan keterampilan kandidat baru dijalankan secara bersamaan. Hanya ketika keterampilan baru benar-benar lebih unggul daripada keterampilan lama pada tingkat keberhasilan tugas secara keseluruhan dan stabilitas eksekusi, barulah ia diterima dan dideploy. Ini memastikan kumpulan keterampilan yang telah dideploy tidak merosot seiring waktu, sehingga terjadi peningkatan performa yang berkelanjutan dan stabil.
4. Pengujian berkelanjutan untuk versi pratinjau dan post-training
Saat ini, model pratinjau Qwen 3.8-Max yang sudah diluncurkan sedang berevolusi secara berkelanjutan dalam satuan “hari”. Ada analisis yang menunjukkan bahwa pembaruan berkelanjutan untuk versi kecil dari basis parameternya ini mengindikasikan model mungkin sedang menjalani post-training yang intensif, sebagai persiapan untuk rilis resmi versi final 4.0.
1. Bobot dan pembaruan jalur (link) otomatis berfrekuensi tinggi
Qwen 3.8 memecah pola tradisional dengan rilis besar sekali jalan, dan membangun mekanisme iterasi otomatis berfrekuensi tinggi. Tim mengungkapkan bahwa model akan otomatis memperbarui bobot setiap dini hari, menyegarkan optimasi jalur inferensi setiap 48 jam, dan mendorong kemampuan penyelarasan multimodal yang benar-benar baru setiap minggu. Mekanisme ini membuat peningkatan model berubah menjadi sebuah acara “siaran langsung” yang berlangsung terus-menerus.
2. Routing ahli dinamis dan arsitektur cache memori bertingkat
Pada tingkat arsitektur, Qwen 3.8 meninggalkan trik aktivasi jarang (sparse) tradisional, dan mengadopsi arsitektur hibrida berupa “dynamic expert routing + hierarchical memory cache”. Desain ini membuat 2,4T parameter dapat bekerja secara dinamis; saat berjalan, model “bukan dibangun jadi monster raksasa yang ditumpuk, melainkan adalah agen cerdas yang bisa bernapas, bisa merefleksikan, dan tahu kapan harus memilih.” Optimasi arsitektural inilah yang menjadi fondasi teknis bagi iterasi berfrekuensi tinggi.
3. Mekanisme “evolusi dan verifikasi pada malam hari” untuk kemampuan Agen (Agent)
Pada level eksekusi tugas Agent yang spesifik, seri Qwen (misalnya Qwen3-Max) menerapkan “alur evolusi keterampilan kolektif”. Mekanisme ini mengubah sesi interaksi nyata pengguna menjadi bukti yang terstruktur, lalu Evolver menganalisis pola dan menghasilkan pembaruan kandidat. Keterampilan kandidat ini tidak langsung ditayangkan, melainkan masuk ke “tahap verifikasi pada malam hari”: di lingkungan nyata, keterampilan lama dan keterampilan kandidat baru dijalankan secara bersamaan. Hanya ketika keterampilan baru benar-benar lebih unggul daripada keterampilan lama pada tingkat keberhasilan tugas secara keseluruhan dan stabilitas eksekusi, barulah ia diterima dan dideploy. Ini memastikan kumpulan keterampilan yang telah dideploy tidak merosot seiring waktu, sehingga terjadi peningkatan performa yang berkelanjutan dan stabil.
4. Pengujian berkelanjutan untuk versi pratinjau dan post-training
Saat ini, model pratinjau Qwen 3.8-Max yang sudah diluncurkan sedang berevolusi secara berkelanjutan dalam satuan “hari”. Ada analisis yang menunjukkan bahwa pembaruan berkelanjutan untuk versi kecil dari basis parameternya ini mengindikasikan model mungkin sedang menjalani post-training yang intensif, sebagai persiapan untuk rilis resmi versi final 4.0.