🤯 Um modelo de IA 27B agora está rodando localmente em uma RTX 4060 com apenas 8GB de VRAM.
Qwen 3.8-27B + nova quantização IQ4_XS do Unsloth:
→ Contexto de 64K
→ ~14,6GB em disco
→ ~150 tok/s no prefill
→ ~5 tok/s no decode
→ Sem vazamento de memória da GPU
E o Qwen 3.8-27B supostamente supera o Claude Opus 4.6 em vários benchmarks.
Um modelo de nível avançado rodando em uma GPU de consumo de ~$300.
A IA local está ficando muito séria. 🔥
Qwen 3.8-27B + nova quantização IQ4_XS do Unsloth:
→ Contexto de 64K
→ ~14,6GB em disco
→ ~150 tok/s no prefill
→ ~5 tok/s no decode
→ Sem vazamento de memória da GPU
E o Qwen 3.8-27B supostamente supera o Claude Opus 4.6 em vários benchmarks.
Um modelo de nível avançado rodando em uma GPU de consumo de ~$300.
A IA local está ficando muito séria. 🔥
