🤯 Một mô hình AI 27B đang chạy cục bộ ngay bây giờ trên RTX 4060 chỉ với 8GB VRAM.

Qwen 3.8-27B + bản lượng tử IQ4_XS mới của Unsloth:
→ Ngữ cảnh 64K
→ ~14,6GB trên đĩa
→ ~150 tok/s cho prefill
→ ~5 tok/s cho decode
→ Không bị tràn bộ nhớ GPU

Và Qwen 3.8-27B được cho là vượt Claude Opus 4.6 trên một số bộ benchmark.

Một mô hình tầm biên giới chạy trên GPU tiêu dùng khoảng ~$300.

AI cục bộ đang trở nên rất nghiêm túc. 🔥