摩根士丹利最新研報指出,AI 記憶體短缺恐貫穿整個週期,但輝達不會坐等擴產——傳將為 Rubin 平台推出降規版,HBM4 從 288GB 砍到 192GB、LPDDR5 從 54TB 砍到 28TB。需求並未消失,而是向 NAND、DRAM 與高速互連轉移,CXL 市場 2030 年上看 60 億美元。 (前情提要:高盛喊價鎧俠!目標價拉到 11.6 萬日圓、買進評級:AI 造成 NAND 缺貨到 2028 年) (背景補充:長江儲存擴產近 25% 喊話 2027 稱霸 NAND,傳 Q4 掛牌 IPO 籌彈藥)   當所有人都在追 GPU 數量時,摩根士丹利半導體分析師 Joseph Moore 在最新報告中丟擲一個反直覺警告:AI 競賽真正的瓶頸已轉向記憶體,而輝達的解法竟是「減配」。報告揭露,Rubin 平台的 HBM4 配置可能從 288GB 下修至 192GB、機架級 LPDDR5 從 54TB 砍半至 28TB——這不是需求見頂的訊號,而是供應緊張迫使整個 AI 產業重新設計系統架構的開端。 TL;DR: AI 記憶體短缺可能貫穿整個週期。摩根士丹利認為,模型規模、上下文長度和推理併發量持續增長,將不斷吸收新增儲存供應。 輝達開始為 Rubin 提供「減配」方案。部分 HBM 和 LPDDR5 容量可能下調,但需求並未消失,而是向 NAND、DRAM 和高速互連轉移。 AI 推理架構正在重構。Prefill 與 Decode 分離,有望提高硬體利用率,為 Cerebras、輝達 Groq 等技術方案創造機會。 CXL 有望成為新的增長點。摩根士丹利預計,2030 年相關半導體市場規模約達 60 億美元,Astera Labs 和 Marvell 是潛在受益者。 儲存股的關鍵是週期持續時間,而非短期漲價幅度。摩根士丹利維持增持美光和閃迪,主要風險在於 AI 投資及資料中心建設放緩。 以下為原文編譯: AI 基礎建設正面臨一個愈來愈棘手的問題:算力能靠加購 GPU 快速擴充,記憶體供應卻無法同步跟上。 摩根士丹利認為,未來一段時間內,AI 需求仍將持續吸納大量新增的記憶體供給。即使不同時期的緊缺程度有所波動,DRAM 產能擴張仍難以迅速消除供需缺口。 摩根士丹利與多家運算業者訪談後發現,如何繞過記憶體瓶頸已成為越來越重要的話題。輝達 CEO 黃仁勳也談到了透過計算、網路和儲存系統的協同設計緩解供應限制的必要性。 分析師認為,這不是對儲存需求轉弱的預警,而是整個 AI 產業不得不面對的現實:當記憶體無法按原計劃供應時,企業必須找到新的系統架構,讓現有硬體繼續支援 AI 增長。 最直覺的應變,就是下修單一伺服器或單顆 GPU 內建記憶體規格。 輝達 Rubin 竟然「減配」:HBM4 砍至 192GB 摩根士丹利指出,DRAM 和 NAND 供應緊張及價格上漲,正在迫使 AI 產業鏈重新考慮產品配置。對於晶片廠商而言,與其堅持原有規格、導致系統無法按計劃交付,不如提供不同記憶體容量的版本,讓客戶根據實際需求選擇。 研報預計,輝達可能為 Rubin 平台提供多種較低記憶體配置。 在機架級記憶體方面,Rubin 原先規劃的 LPDDR5 容量約為 54TB,而部分新配置可能降至 28TB,對應 SOCAMM2 記憶體模組容量從 192GB 降至 96GB。 在 HBM 方面,Rubin 單 GPU 原先預計配備 288GB HBM4,採用 8 組 12 層堆疊設計;摩根士丹利預計,輝達可能增加配備 192GB HBM4 的產品版本,將堆疊層數降至 8 層。 對於 Rubin Ultra,研報認為,在調整為雙計算芯粒方案後,512GB 是更合適的比較基準,未來可能出現約 192GB 至 384GB 的不同容量選擇。 這些均屬於摩根士丹利截至研報發布日對產品配置的判斷,並非所有規格都已得到輝達正式確認。 若從成本面檢視,這套策略相當合理。降低 HBM 堆疊層數可以減少容量,而在介面數量和引腳速率等條件不變時,理論頻寬不一定同步下降。 但容量和頻寬解決的是兩個不同問題。對於模型較小、上下文較短的應用,降低容量可能影響有限;但當模型越來越大、推理任務越來越複雜時,記憶體容量不足仍可能導致更多資料需要在不同儲存層級之間轉移,增加延遲或 GPU 使用量。 更重要的是,減少 HBM 並不會讓 AI 原本需要處理的資料消失,只會讓這些資料尋找新的存放位置。 例如,當 GPU 的 HBM 容量不足時,部分資料可能需要儲存在主記憶體中;當機架級 LPDDR5 容量降低時,部分 KV Cache(鍵值快取)需求又可能轉向 NAND 快閃記憶體。 KV Cache 是大模型推理過程中用於儲存歷史計算資訊的快取。隨著上下文變長、同時執行的請求增加,其容量需求也隨之上升。 記憶體需求並未消失,只是轉往其他層級。 摩根士丹利指出,輝達降低部分 LPDDR5 配置的同時,產業鏈已經觀察到來自 NAND 的新增需求。HBM 容量減少還可能增加 GPU 間的資料傳輸,使高速互連網路承擔更大壓力。 需求沒消失:資料被掃向 NAND 與互連晶片 這意味著,輝達的減配策略可能暫時緩解 DRAM 供應約束,卻同時增加對 NAND、互連晶片以及更大規模 GPU 叢集的需求。 這股壓力轉移背後有長遠結構因素。 根據研報引用的 Epoch AI 歷史資料,大語言模型時代的前沿模型引數規模曾呈現約每六個月翻倍的增長趨勢。上下文視窗也經歷了快速擴張。同時,更多 AI 應用從簡單問答轉向程式設計、複雜推理和長時間執行的 Agent 任務,進一步推高記憶體使用量。 摩根士丹利認為,模型規模、上下文長度和推理併發量將繼續推動儲存需求增長。因此,降低部分產品配置更可能是供應緊張時期的過渡方案,而不是 AI 記憶體需求長期下降的訊號。 如果說減少記憶體配置是短期應對措施,那麼改變 AI 推理的計算方式,則可能帶來更深層次的產業變化。 摩根士丹利關注的第二條路...〈AI 記憶體荒為何反讓輝達減配?大摩:瓶頸將把資料掃向 NAND 與互連晶片〉這篇文章最早發佈於動區BlockTempo《動區動趨-最具影響力的區塊鏈新聞媒體》。