В эти дни проходит конференция Hot Chips 2026, которую называют барометром полупроводниковой отрасли; на ней ключевые вендоры, включая NVIDIA, Micron и SK hynix, выступили с техническими докладами, сфокусированными на следующей эволюции инфраструктуры ИИ-вычислений. В последние годы компании соревновались в плотности транзисторов и пиковой производительности; однако эта конференция показала, что главные узкие места ИИ-вычислительной мощности сместились с вычислительных ядер на эффективность передачи данных и архитектуру систем хранения. Память превращается из простого «контейнера данных» в системный компонент. HBM является ключевым двигателем текущего цикла «суперпамяти», но и она сталкивается с физическими ограничениями. Micron раскрыла, что при одинаковой емкости размер кремниевой подложки для HBM3E примерно в 3 раза больше, чем для традиционной DDR5, из-за огромных параллельных трактов данных, TSV и сети электропитания: в типичной GPU-упаковке доля площади кремния под микросхемы памяти в системном уровне упаковки составляет около 90%. Огромный расход производственных мощностей пластин под HBM затрудняет отрасли быстро реагировать на всплески спроса, что ведет к высоким ценам и добавляет к «ценовой стене» производительности данных еще и «стоимостную стену» сверх ограничений производительности на перемещение данных. SK hynix также отмечает, что по мере продвижения HBM к 16 слоям и даже 20, охлаждение и корпусирование приближаются к физическому пределу; переход к гибридной (гибридно-связанной) сборке становится неизбежной тенденцией.
Перед лицом узких мест производители памяти начинают расширяться в сторону логических вычислений. Samsung предложила понятную трёхэтапную дорожную карту, стремясь сделать базовую пластину HBM интеллектуальной платформой ИИ. Первый этап — кастомизация HBM (cHBM): перенос контроллера памяти на базовую пластину HBM, изготавливаемую по продвинутому логическому техпроцессу. Используя специализированный интерфейс D2D между кристаллами вместо традиционного HBM PHY, можно вернуть 5–10% кремниевой площади для XPU и преобразовать её в прирост системной производительности на 10–20%. Второй этап — продвинутая HBM (AHBM): на участках, где базовая пластина простаивает, интегрируются блоки обработки, чтобы разгрузить отнимающий максимум пропускной способности механизм внимания при выводе больших моделей в «вычисление рядом с памятью». Третий этап — 3D‑стекирование HBM (zHBM): отказ от промежуточного слоя 2.5D и вертикальная укладка HBM прямо над XPU. По данным Samsung, по сравнению со стандартным HBM4E у zHBM I/O‑энергопотребление составляет лишь около 0,5 pJ/bit, что снижает общее энергопотребление DRAM примерно на 70%, а пропускную способность увеличивает более чем в 2,3 раза. На уровне одного модуля можно сэкономить до 100 Вт, передав примерно 8,3% «запаса по мощности» ускорителю. Для реализации требуются wafer‑to‑wafer соединение и гибридный медный бондинг с шагом менее 6 микрон, а также необходимость с самого начала глубоко совместного проектирования DRAM и логики SoC.
На стороне вывода рост требований к ёмкости приводит к тенденции к многоуровневому хранению. Столкнувшись с длинными контекстами и большим объёмом KV-кэша, одних лишь затрат на HBM становится недостаточно. В отрасли предложили высокоскоростную флеш-память (HBF) ёмкостью, которая в десятки раз превышает HBM: хотя пропускная способность на 1 ГБ составляет лишь 1/25 от HBM, в сценариях вроде работы на одном узле с моделями триллионного масштаба, низких батчей или разреженного внимания HBF как слой высокоёмкой вторичной памяти демонстрирует отличную экономичность. Рост спроса на жёсткие диски со стороны ИИ вызывает дефицит поставок: сверхкрупные дата-центры начинают шире внедрять недорогие SSD формата QLC между TLC SSD и HDD, повышая производительность системы и одновременно стимулируя отгрузки NAND.
Для рынка сигналы Hot Chips — это не просто краткосрочные новости на несколько кварталов, а указание на стратегические тенденции на ближайшие 3–5 лет. Долгосрочную ценность цепочки можно рассматривать с трёх точек зрения. Во‑первых, производители памяти: по мере того как HBM движется в сторону кастомизации и даже вертикальной интеграции с вычислительными чипами (zHBM), Samsung, SK hynix и др. переходят от роли простых «продавцов памяти» к совместному проектированию интеллектуальных вычислительных платформ. Они глубоко включаются в определение архитектуры следующего поколения ускорителей, получая более сильные возможности для наценки и более высокую незаменимость. Во‑вторых, передовая упаковка и материалы ключевого оборудования: эволюция от микровыступов к гибридному бондингу и от 2.5D к 3D-сборкам с укладкой WoW приведёт к существенному приросту капитальных затрат; для поставок оборудования и материалов найдётся место — от установок для травления TSV в производстве, машин гибридного бондинга, тестового оборудования до материалов высокопроизводительных тепловых интерфейсов. Поставщики оборудования/материалов, которые могут подтверждать совместимость и тестировать это на практике, получат дефицитную премию. В‑третьих, универсальное ИИ‑железо: в будущем не будет единого подхода «всем по одному». На стороне обучения понадобятся zHBM — высокопропускная и высокоплотная интеграция; а на стороне вывода сформируется гетерогенная многоуровневая система, где основными компонентами станут HBF, высокоёмкая LPDDR и enterprise‑класса QLC SSD. В эпоху глубокой интеграции «вычисления рядом с памятью» чем ближе к данным находится узел, тем больше создаётся коммерческой ценности.