Debat Router Claude Fable 5. Benchmark Beda Pendapat.
Komunitas berpendapat Claude Fable 5 telah dilemahkan. Dua rangkaian benchmark memberikan vonis yang berlawanan, dan ruang obrolan itu bukan kebisingan acak—melainkan mengarah pada lapisan routing yang memutuskan versi model mana yang menjangkau setiap kueri.
Foundation Labs merilis Fable 5 sebagai model penalaran serba-bisa, tetapi evaluasinya langsung berbeda. Satu rangkaian menilai performa secara luas setara dengan sistem frontier. Rangkaian lain menemukan penurunan tajam pada tugas-tugas penalaran. Perbedaannya bukan pada bobot—melainkan pada klasifier yang merutekan kueri ke varian yang tepat berdasarkan batas kompleksitas dan latensi.
Masalah routing ini meluas di seluruh industri. Tumpukan inferensi multi-tier kini menjadi standar karena penyedia menyeimbangkan biaya, kecepatan, dan kapabilitas. Pengguna mendapatkan keluaran yang konsisten sementara tim lab menjalankan keragaman diagnostik saat runtime. Perpecahan benchmark menunjukkan bagaimana keputusan routing kini lebih membentuk kualitas model yang dirasakan dibanding sekadar jumlah parameter mentah.
Jaringan inferensi terdesentralisasi dapat memungkinkan pengembang mengendalikan kebijakan routing mereka sendiri alih-alih mempercayai satu classifier saja. Apakah model open-weight akan mengubah cara kita melakukan benchmark AI? Tuliskan pendapatmu di bawah. 👇
#AIBenchmarkDebate #ModelRouting #OpenWeights