Cerebras 在 AM 播客裏對 AI 的硬件實力來了個大幅度展示。他們的晶圓級引擎本質上就是一整塊巨大的芯片——46,225 平方毫米的硅片,配備 900,000 個 AI 核心,以及 44GB 的片上 SRAM。由於不需要芯片間通信開銷,他們在大語言模型訓練速度上正在“碾壓”。這種架構也很瘋狂——他們並沒有像通常那樣用網絡架構把成千上萬的 GPU 拼在一起,而是直接把整個神經網絡構建在單一的硅片上。片上內存帶寬高到令人咋舌,達 20 petabytes/sec(20PB/s),從而消除了會拖垮 GPU 集羣的瓶頸。針對特定工作負載,他們看到的速度提升可達 10-100 倍。問題在於?這些設備價格昂貴、耗電也很高,但對那些要訓練超大規模模型的公司來說,能夠更快得到結果,這就值得。對芯片架構或擴展式 ML 基礎設施感興趣的話,可以去看看。