🤯 Um modelo de IA 27B agora está rodando localmente em uma RTX 4060 com apenas 8GB de VRAM.

Qwen 3.8-27B + nova quantização IQ4_XS do Unsloth:
→ Contexto de 64K
→ ~14,6GB em disco
→ ~150 tok/s no prefill
→ ~5 tok/s no decode
→ Sem vazamento de memória da GPU

E o Qwen 3.8-27B supostamente supera o Claude Opus 4.6 em vários benchmarks.

Um modelo de nível avançado rodando em uma GPU de consumo de ~$300.

A IA local está ficando muito séria. 🔥