🚨 $KIMI 將 2.78T 參數壓縮進 8GB 內存——而且不需要 GPU!💥
🔍 這個開源實驗挑戰了關於推理擴展性的每一個假設。一個 176KB 的純 C99 項目,通過按需從 NVMe 存儲流式讀取專家權重,在僅 8GB 內存中運行 Kimi K3 的 1.56TB 權重集。💡
“魔法”來自 MoE 稀疏激活——每一層只有 896 名專家中的 16 名被激活。於是開發者用閃存存儲帶寬去交換 RAM,將磁盤視爲內存的一個慢速延伸。📊 代價非常殘酷:每 32.7 秒纔出產 1 個 token。這當然不適合生產,但它是超低成本推理基礎設施的結構性藍圖。
更大的信號在於方向。📉 當硬件瓶頸迫使人們進行更有創意的工程實現時,效率就會成爲下一個敘事。我們是在爲下一波去中心化 AI 搭建“管道”嗎?💬
⚠️ 不是理財建議。請務必管理好你的風險。🛡️
🏷️
#KIMI #AI #MoE #OpenSource #Crypto 💡 🔥