🤯 Un modèle IA de 27B, maintenant, fonctionne localement sur un RTX 4060 avec seulement 8 Go de VRAM.
Qwen 3.8-27B + nouvelle quantification IQ4_XS d’Unsloth :
→ contexte 64K
→ ~14,6 Go sur le disque
→ ~150 tok/s en pré-remplissage (prefill)
→ ~5 tok/s en décodage (decode)
→ Aucun débordement de mémoire GPU
Et Qwen 3.8-27B battrait apparemment Claude Opus 4.6 sur plusieurs benchmarks.
Un modèle de niveau “frontière” qui tourne sur un GPU grand public à ~300 $.
L’IA locale devient vraiment très sérieuse. 🔥
Qwen 3.8-27B + nouvelle quantification IQ4_XS d’Unsloth :
→ contexte 64K
→ ~14,6 Go sur le disque
→ ~150 tok/s en pré-remplissage (prefill)
→ ~5 tok/s en décodage (decode)
→ Aucun débordement de mémoire GPU
Et Qwen 3.8-27B battrait apparemment Claude Opus 4.6 sur plusieurs benchmarks.
Un modèle de niveau “frontière” qui tourne sur un GPU grand public à ~300 $.
L’IA locale devient vraiment très sérieuse. 🔥
