🤯 27BのAIモデルが、VRAM 8GBだけのRTX 4060上でローカル実行できるようになりました。

Qwen 3.8-27B + Unslothの新しいIQ4_XS量子化:
→ 64Kコンテキスト
→ 約14.6GB(ディスク)
→ 約150 tok/s(プリフィル)
→ 約5 tok/s(デコード)
→ GPUメモリのオーバーフローなし

そして、Qwen 3.8-27Bは複数のベンチマークでClaude Opus 4.6に勝っていると報告されています。

フロンティア級モデルが、約$300のコンシューマーGPUで動作。

ローカルAIが本気になってきています。🔥