🤯 Un modelo de IA 27B ya está funcionando localmente en un RTX 4060 con solo 8GB de VRAM.

Qwen 3.8-27B + la nueva cuantización IQ4_XS de Unsloth:
→ Contexto de 64K
→ ~14.6GB en disco
→ ~150 tok/s en prefill
→ ~5 tok/s en decode
→ Sin derrames de memoria de GPU

Y se informa que Qwen 3.8-27B supera a Claude Opus 4.6 en varios benchmarks.

Un modelo de nivel frontera funcionando en una GPU de consumo de ~$300.

La IA local está tomando en serio. 🔥