🚨 $KIMI はGPUなしで、2.78Tのパラメータを8GB RAMに圧縮 — 💥
🔍 このオープンソースの実験は、推論のスケーリングに関するあらゆる前提に挑戦します。176KBの純粋なC99プロジェクトが、NVMeストレージから必要に応じてエキスパートの重みをストリーミングすることで、Kimi K3の1.56TB重みセットをわずか8GBのメモリで動かします。💡
魔法の鍵はMoE(Mixture of Experts)によるスパースな活性化 — 各層で896人のエキスパートのうち稼働するのは16だけです。つまり開発者は、RAMのためにフラッシュストレージの帯域を引き換えにし、ディスクをメモリの遅い拡張のように扱っています。📊 トレードオフは苛烈です。1トークンあたり32.7秒。これは実運用に耐えるものではありませんが、超低コストな推論インフラのための構造的な設計図にはなっています。
より大きなシグナルは方向性です。📉 ハードウェアのボトルネックが創造的なエンジニアリングを強いるとき、効率性が次の物語になります。私たちは、分散型AIの次の波のための配管(基盤)を作っているのでしょうか?💬
⚠️ 投資助言ではありません。常にリスクを管理してください。🛡️
🏷️ #KIMI #AI #MoE #OpenSource #Crypto
💡 🔥
🔍 このオープンソースの実験は、推論のスケーリングに関するあらゆる前提に挑戦します。176KBの純粋なC99プロジェクトが、NVMeストレージから必要に応じてエキスパートの重みをストリーミングすることで、Kimi K3の1.56TB重みセットをわずか8GBのメモリで動かします。💡
魔法の鍵はMoE(Mixture of Experts)によるスパースな活性化 — 各層で896人のエキスパートのうち稼働するのは16だけです。つまり開発者は、RAMのためにフラッシュストレージの帯域を引き換えにし、ディスクをメモリの遅い拡張のように扱っています。📊 トレードオフは苛烈です。1トークンあたり32.7秒。これは実運用に耐えるものではありませんが、超低コストな推論インフラのための構造的な設計図にはなっています。
より大きなシグナルは方向性です。📉 ハードウェアのボトルネックが創造的なエンジニアリングを強いるとき、効率性が次の物語になります。私たちは、分散型AIの次の波のための配管(基盤)を作っているのでしょうか?💬
⚠️ 投資助言ではありません。常にリスクを管理してください。🛡️
🏷️ #KIMI #AI #MoE #OpenSource #Crypto
💡 🔥