Меняется подлежащее в ИИ: от покупки GPU к сдаче в эксплуатацию ИИ‑фабрик

Когда балансовая вычислительная мощность перестаёт равняться реальному выпуску, порядок распределения ценности в цепочке поставок начинает перестраиваться.

За последние два года нарратив вокруг базовой инфраструктуры ИИ почти полностью определяли три вещи.

GPU (Graphics Processing Unit, графический процессор), HBM (High Bandwidth Memory, память с высокой пропускной способностью) и передовая упаковка.

Эта логика попала в самую суть первой волны экспансии и постепенно сформировала на рынке почти рефлекторное понимание: чем больше чипов, тем выше вычислительная мощность, тем больше производственная мощность.

И вот сегодня это уравнение начинает давать сбой.

GPU могут прибыть, серверы — быть размещены на складе, а капитальные затраты — продолжать расти, но вычислительные мощности вовсе не обязательно будут вовремя введены в эксплуатацию. Полностью возможно, что один AI-завод одновременно имеет самые дорогие устройства и при этом самые неудобные ожидания.

Ждать электричества, ждать охлаждения, ждать сети, ждать данных, ждать диспетчеризацию.

Чипы уже заняли место в балансе, но реальная мощность еще остается на стадии строительства, пусконаладки и системной интеграции. Состав закупочного плана выглядит красиво, но кластеров, которые реально стабильно работают, оказывается меньше, чем ожидалось. Оборудование формально развернуто, но фактическая загрузка и удельная выработка остаются невысокими.

Такой разрыв меняет способ измерения AI-отрасли.

В фокусе первой волны конкуренции — кто сможет получить больше чипов. Разница на следующем этапе больше проявляется в том, кто сможет организовать чипы в устойчиво работающий AI-завод.

Чип определяет теоретический предел, система — коэффициент реализации.

Понять это — значит действительно войти в следующую фазу AI-инфраструктуры.

Дефицит чипов объясняет первую половину истории

GPU по-прежнему — ключевое оборудование для AI-вычислений.

Обучение и инференс больших моделей требуют выполнения параллельных вычислений огромного масштаба; GPU предоставляет важнейшую вычислительную мощность. HBM вплотную к ускорителю передает данные в вычислительные блоки с очень высокой пропускной способностью. Насколько бы ни были сильны характеристики чипа, если данные не прибывают вовремя, вычислительные блоки тоже будут ждать.

Передовая упаковка отвечает за то, чтобы вычислительные чипы, HBM и высокоскоростные соединения были организованы в плотную структуру. Вычислительная мощность, пропускная способность памяти, площадь чипа, энергопотребление и тепловыделение в итоге должны сойтись на уровне упаковки.

Без этих базовых «оснований» AI-завод вообще не о чем говорить.

В последние годы у рынка были достаточно убедительные реальные основания строить ожидания AI-благоприятности вокруг закупок GPU, квот HBM и планирования производства продвинутой упаковки. Когда всей отрасли больше всего не хватает высокопроизводительных вычислительных чипов, тот, кто сможет их получить, оказывается ближе всего к верхней границе мощностей.

Тогда основное противоречие концентрируется в самих производственных ресурсах.

Если чипов не хватает, даже при отличных условиях сети, электропитания и охлаждения нет достаточного оборудования, чтобы работать. Поставочный ритм высококлассных GPU почти напрямую определяет планы обучения компаний и скорость расширения вычислительных мощностей у облачных провайдеров.

Старая рамка по-прежнему верна, но она уже не объясняет все проблемы.

Когда все больше средств, талантов и ресурсов цепочки поставок стекаются в сторону чипов, первый порог постепенно начинает быть более широко осознанным, а следующие ограничения — выходят в поле зрения. Важным остается вопрос, можно ли произвести чипы. После того как чипы произведены — смогут ли они вовремя сформировать пригодные мощности — становится другой столь же дорогой сложной задачей.

AI-инфраструктура переходит от дефицита производственных ресурсов к конкуренции за системные возможности поставки.

Один AI-завод намного сложнее, чем один список закупок.

Список закупок может подсказать, сколько GPU, сколько серверов и сколько стоек люди покупают.

Она не отвечает на то, когда эти устройства можно включить, когда они смогут стать стабильным кластером, когда они начнут принимать реальную нагрузку и когда смогут в разумной стоимости постоянно предоставлять услуги обучения и инференса.

Отгрузка чипов с завода и реальное выполнение задач модели отделены очень длинной цепочкой.

GPU и HBM нужно упаковать в поставляемую платформу, а затем переходить к платам, серверам и стойкам.

Стойкам нужно достаточно электроэнергии и охлаждения, а множеству узлов требуется координация через высокоскоростную сеть. Тренировочные данные и контекст инференса должны постоянно перемещаться между вычислениями, памятью и хранением; при этом диспетчерская система должна уменьшать очереди, перегрузки и «холостой ход».

Далее всей системе предстоит пройти установку, комплексную наладку, тесты нагрузки, учения по отказам и приемку на месте.

Пока любая часть приходит позже, весь предыдущий капитал ждет.

Чипы уже поставлены, но электропитание стоек еще не подготовлено — оборудование вынуждено простаивать на складе или в машинном зале. Стойки уже подключены к сети, но возможности охлаждения не хватает — система не может долго работать на полной нагрузке. Все железо на месте, но сеть перегружена — множество GPU все еще ждут данных и синхронизации.

Вот в чем самое важное различие AI-заводов и обычных дата-центров.

Традиционные дата-центры способны размещать много крупных, относительно независимых серверов и обрабатывать нагрузки хранения, сайтов, корпоративного ПО и универсального облачного вычисления. AI-завод должен организовать масштабные вычислительные узлы так, чтобы они совместно работали вокруг одной задачи обучения или инференс-сервиса.

Требования к синхронности эффективности, плотности по мощности, тепловому менеджменту, пропускной способности памяти и устойчивости работы намного выше.

Один мощный сервер — это одно, но это не выводит автоматически, что весь кластер будет столь же мощным.

Чем больше узлов, тем выше сложность координации системы. Задержка на локальных каналах, отказ одного устройства, аномальная температура в одном месте — все это может замедлить целую партию дорогих вычислительных ресурсов.

Раньше люди понимали вычислительные мощности как сумму чипов и серверов.

Теперь более близкое к реальности понимание такое: AI-вычислительная мощность — это системный выпуск, который формируется после упаковки, соединения, электропитания, охлаждения, хранения и диспетчеризации.

Поставка устройств означает, что активы уже сформированы.

Только стабильная работа показывает, что производственные мощности действительно сформированы.

Эффективные вычислительные мощности становятся новой мерой

То, что описывает вычислительные мощности на бумаге, — это количество устройств и теоретический пик.

Эффективные вычислительные мощности интересуются тем, сколько эти устройства в итоге обеспечивают стабильной, управляемой и устойчивой работы обучения и инференса.

Одинаково масштабированные кластеры GPU могут иметь полностью различный фактический выпуск.

В одной системе частое ожидание сетевой связи и чтения данных снижает загрузку GPU ниже ожиданий. В другой системе, более зрелой по сети, памяти и диспетчеризации, даже без явного преимущества по масштабу железа, за то же время можно выполнить больше задач.

Цифры на бумаге выглядят близкими, но реальная производственная мощность уже разошлась.

Эффективные вычислительные мощности как минимум включают несколько смыслов.

Оборудование должно быть введено в строй вовремя, кластер — эффективно координироваться, задачи — стабильно выполняться, а удельная стоимость выпуска — оставаться в диапазоне, который позволяет это использовать на постоянной основе.

Требования к этой системе для обучения и инференса не одинаковы.

Во время обучения модель обычно разбивают на множество GPU. Разным узлам приходится часто обмениваться данными и синхронизировать параметры. Если часть узлов начинает работать медленнее, остальные тоже начинают ждать.

Такое ожидание не отражается в теоретических характеристиках чипа, но напрямую проявляется в длительности обучения, стоимости электроэнергии, загрузке оборудования и инженерных затратах.

Для инференса — другая модель давления.

Реальные пользователи постоянно отправляют запросы: системе нужно начинать отвечать за относительно короткое время и сохранять стабильность в условиях высокой параллельности.

Контекст становится все длиннее, многораундовые взаимодействия — все более распространенными; агентам приходится вызывать инструменты и выполнять более сложные задачи, а системе нужно хранить и многократно перечитывать огромные объемы промежуточного состояния.

KV cache (Key-Value cache, кэш «ключ-значение») постепенно превратился из технической детали в важную часть затрат на инференс.

Эти промежуточные состояния занимают дорогую видеопамять и также влияют на память, хранение, сеть и диспетчеризацию.

Если все поместить в HBM, стоимость слишком высока. Перенос в обычную память или хранение приводит к росту задержек доступа. Система должна постоянно выбирать между скоростью, емкостью и стоимостью.

Поэтому удельная стоимость токена становится еще более важным показателем.

Стоимость одного токена в конечном счете определяется совместно вычислительным чипом, памятью, сетью, хранилищем, электропитанием, охлаждением и эффективностью ПО. GPU — лишь самая дорогая и самая заметная часть среди них.

Если данные не удается своевременно доставить на GPU, дорогое оборудование будет работать «вхолостую».

Если сеть «забивается», ухудшаются инференс-пропускная способность и время отклика.

Если эффективность управления кешем слишком низкая, видеопамять быстро будет полностью занята.

Если мощностей охлаждения недостаточно, оборудование не сможет поддерживать высокую нагрузку.

Если восстановление после отказов медленное, один локальный сбой может потянуть за собой целую партию задач.

Эти детали, похожие на инженерные вопросы в машинном зале, в итоге приводят к одному и тому же коммерческому результату.

Тот же объем капитальных вложений — но сколько реально можно произвести устойчивых моделей?

Чем больше масштаб, тем дороже становятся системные слабые места.

Небольшие кластеры могут скрывать многие проблемы за счет избыточности и ручного вмешательства.

После увеличения масштаба локальные проблемы быстро превращаются в системные.

Добавление вычислительных узлов не приводит к естественному росту выпуска в той же пропорции. Чем узлов больше, тем сложнее коммуникации и синхронизация и тем больше точек отказа.

Плотность по мощности, тепло и нагрузка на разводку будут расти одновременно; затраты на координацию внутри системы начинают «съедать» часть прироста аппаратных мощностей.

Это и есть причина, почему сеть раньше всего выходит на передний план.

Одна GPU может самостоятельно выполнять часть задач, но обучение больших моделей зависит от крупномасштабной совместной работы.

Узлам нужно быстро и стабильно обмениваться данными. Даже небольшое снижение эффективности соединений заставляет дорогое вычислительное оборудование тратить больше времени на ожидание.

Даже добавление GPU продолжает увеличивать теоретические вычислительные мощности, но прирост выпуска не растет синхронно.

Ограничения, которые приносит электричество, становятся еще более прямыми.

Получить землю и план электроснабжения для дата-центра — не значит, что электроэнергия уже поступила в стойку.

Емкость еще должна пройти объединение в сеть, трансформаторную подстанцию, внутриплощадочное распределение, резервное электропитание, шины и преобразования внутри стойки. Любая задержка на любом этапе сдвигает ввод оборудования в строй.

После того как электроэнергия попадает в чипы, почти всегда она превращается в тепло.

По мере постоянного роста мощности одной стойки традиционное воздушное охлаждение с точки зрения вместимости постепенно становится более узким местом.

Жидкостное охлаждение начинает переходить из инфраструктуры машинных залов в конструкции серверов и стоек, и дальше влияет на разводку труб, распределение хладагента, процессы обслуживания, планировку машинного зала и приемку на месте.

Поэтому меняется и смысл решений по охлаждению.

Это влияет не только на температуру чипа — меняется и то, когда проект будет сдан, кто отвечает за сбои, как обслуживается оборудование и сможет ли стойка долго поддерживать высокую нагрузку.

После масштабирования инференса системное давление продолжает распространяться на память и хранение.

Длинный контекст, многораундовые диалоги и задачи агентов порождают больше состояния.

Система должна решить, какие данные держать в быстрой видеопамяти, какие — в обычной памяти, какие — переносить в локальное или сетевое хранилище, и какие кеши можно повторно использовать между запросами.

Конкуренция вычислительных мощностей начинает переходить от производительности одной карты к размещению данных и диспетчеризации ресурсов.

Эти ограничения не появляются друг за другом в аккуратном по времени плане. Разные платформы, разные нагрузки, разные машинные залы одновременно сталкиваются с разными слабостями.

Тренировочные кластеры быстрее раскрывают проблемы с сетью и пропускной способностью данных.

Инференс-кластеры легче раскрывают проблемы с контекстной памятью, временем отклика и удельной стоимостью.

В высокомощных машинных залах проблемы с электропитанием и охлаждением возникают раньше.

Общий тренд уже очевиден: чем больше масштаб чипов, тем больше ранее скрытых в тылу вспомогательных звеньев будет переходить в функцию выпуска. Дефицит системы также будет становиться все более дорогим.

История про передовую упаковку начинает уходить глубже

Сеть, электропитание и жидкостное охлаждение выходят на передний план, но это не ослабляет важность передовой упаковки.

Передовая упаковка по-прежнему остается базовым ограничением AI-завода, хотя и сама уже входит в новый этап.

Фокус первого этапа — на производственных мощностях.

Быстрое расширение высококлассных AI-чипов: вычислительные чипы и HBM нужно с помощью сложной упаковки сформировать в высокоплотные взаимосвязи.

Доступный план выпуска ограничен; скорость расширения мощностей напрямую влияет на поставку чипов. Поэтому рынок пристально следит за тем, у кого больше мощностей и кто может расширить их быстрее.

Трудности второго этапа начинают смещаться в сторону добротности (yield), тестирования, подложек, теплового менеджмента, оптоэлектронной координации и системной поставки.

После роста сложности номинальные производственные мощности уже не могут полностью описать реальное предложение.

В одной высококлассной AI-упаковке можно одновременно разместить несколько вычислительных die, несколько стеков HBM, более крупный промежуточный слой и более плотную высокоскоростную взаимосвязь. Стоимость продукта быстро растет, и цена любой локальной неполадки тоже многократно усиливается.

Если проблема возникает на одном die, потери могут быть не ограничены одной микросхемой.

HBM, промежуточные слои, подложки, затраты человеко-часов оборудования и тестовые ресурсы, которые упакованы вместе с этим, тоже могут оказаться потраченными впустую.

Чем выше ценность упаковки, тем раньше нужно уметь выявлять проблемные die, и тем больше требуется после завершения упаковки проводить более сложные системные тесты.

Диспетчеризация производства отвечает за то, сколько можно сделать.

Выход годных изделий и тестирование определяют, сколько можно реально поставить.

Поэтому роль передовых испытаний будет продолжать расти. Много die и стекование HBM делают комбинации дефектов еще более сложными, традиционный выходной контроль уже не достаточен.

Отбор чипов (die selection), тестирование после упаковки, тесты на старение, тепловые циклы и верификация на уровне системы — все это влияет на итоговое качество поставки.

Подложки тоже выходят из «тыловой» части на «передний план».

При увеличении площади упаковки и росте плотности трассировки возрастают требования к плоскостности подложек, контролю коробления, стабильности материалов и возможностям поставки. Одна подложка на первый взгляд — лишь несущая конструкция, но на практике именно она определяет, сможет ли сложный чип стабильно соединиться, контролировать термоупругие напряжения и выйти в массовое производство.

Оптоэлектронная координация поднимает упаковку на еще один уровень сложности.

Когда такие маршруты, как CPO (Co-Packaged Optics, оптика в одной упаковке) продвигают оптический движок ближе к чипу обмена, нужно заново организовать лазерный источник, оптоволоконные соединения, оптическое выравнивание, тепловой менеджмент, надежность и способы обслуживания.

Границы упаковки продолжают расширяться.

Это соединяет не только логические чипы и память: постепенно подключаются вычисления, ввод/вывод, оптика, теплоотвод и системное обслуживание.

Передовая упаковка, конечно, продолжит расширять выпуск, но в будущем более стоящая переоценка часть, вероятно, будет уже не столько концентрироваться на самих номинальных мощностях.

Способности, которые определяют, можно ли сложную упаковку стабильно запустить в массовое производство, снизить потери и уложиться в сроки поставки, получат больший вес в отрасли.

Передовые тесты, высококлассные подложки, измерительное оборудование, ключевые материалы, оптическое выравнивание, тепловой дизайн и системная верификация — все это может стать важными зонами ценности второго этапа передовой упаковки.

Передовая упаковка не ушла с главной линии.

Она переходит от наиболее заметных историй про производственные мощности к более детальным, более трудновоспроизводимым участкам — тем, которые ближе к реальной поставке.

Ценность отрасли концентрируется на возможностях поставки

Когда единица измерения AI смещается от количества устройств к эффективным вычислительным мощностям, порядок ценности в цепочке поставок тоже меняется.

Сеть, электропитание, жидкостное охлаждение, память, хранение, кастомные чипы и передовая упаковка — на вид относятся к разным отраслям. Сейчас они связаны одной и той же проблемой.

Кто сумеет преобразовать чиповые возможности в стабильный системный выпуск.

Раньше сеть в основном выполняла функцию передачи данных. После увеличения масштаба кластера она начинает напрямую влиять на эффективность обучения, пропускную способность инференса и загрузку GPU.

Раньше электричество было фоновой предпосылкой дата-центров. После появления высокомощных стоек время подключения и внутриплощадочное распределение начали определять, когда проект сможет выйти в строй.

Охлаждение прежде считалось вспомогательным оборудованием.

После того как жидкостное охлаждение выходит за пределы инфраструктуры машинного зала и попадает в конструкцию серверов и стоек, оно начинает влиять на проект всей стойки, сроки поставки и ответственность за обслуживание.

Память и хранение раньше больше оценивали по объему. После роста инференс-нагрузки они все глубже вовлекаются во время отклика, повторное использование кеша и удельную стоимость.

Раньше передовая упаковка в основном определялась расширением выпуска и планированием. Выход годных изделий, тестирование, подложки и системная координация перераспределяют ценность заново.

За этой логикой развивается и кастомизация чипов.

Его смысл не только в том, чтобы предложить еще один вариант чипов. Главное — для стабильной нагрузки более плотно организовать вычисления, память, сеть и программную диспетчеризацию, снижая тем самым удельную стоимость выпуска.

Эти изменения не сделают всех связанных поставщиков в среднем более выгодными.

Рост капитальных затрат может доказать наличие спроса, но не доказывает, что прибыль будет распределяться в среднем. Публикация стандартов может показать, что маршрут получил признание, но до масштабного развертывания еще очень долгий инженерный путь.

Макеты и референс-дизайны показывают техническую состоятельность, но выручка массового производства проходит через сертификацию клиентов, адаптацию на месте и стабильную поставку.

После того как отрасль вошла в этот этап, самые ценные способности часто не имеют самых броских параметров.

Это выражается в том, могут ли они поставить вовремя, контролировать выход годных изделий, пройти сертификацию у клиента, решить проблемы интерфейсов системы, нести ответственность за эксплуатационное обслуживание и приемку на месте.

У ведущей по показателям отдельной комплектующей клиент может не спешить применять.

Сбалансированное зрелое решение, даже если параметры не слишком агрессивные, при условии стабильных поставок, удобного обслуживания и возможности вовремя выйти в строй, все равно может сохранить очень сильное положение в отрасли.

Это место также наиболее легко неправильно интерпретировать при переносе пула прибыли на следующем этапе.

Пространство спроса велико, но это не означает, что маржа прибыли обязательно вырастет.

Поступление продукта в AI-цепочку поставок не означает, что у вас есть ценовая власть.

Рост отгрузок идет быстро, но это не означает, что ценность обязательно остается у поставщика.

Ближе всего к пулу прибыли — те компетенции, которые берут на себя ответственность за поставку, снижают потери на уровне системы и которые трудно быстро заменить.

Ценность отрасли не будет закрепляться лишь за самыми модными терминами.

Она будет смещаться в те места, которые сложнее всего решить, которые ближе всего к выпуску и которые чаще всего способны замедлить всю цепочку.

Этот тренд будет переживать повторения

AI-завод движется к системной инженерии — направление уже ясно. Ритм не будет прямой линией.

GPU, HBM и передовая упаковка по-прежнему могут вновь стать самыми жесткими абсолютными «узкими местами». Если у поставок на верхнем уровне снова возникнет дефицит, внимание рынка вернется к самим производственным ресурсам.

Капитальные затраты облачных провайдеров и компаний с моделями тоже влияют на всю цепочку. Если темп строительства замедляется, корректировки затронут сеть, электропитание, жидкостное охлаждение и проекты дата-центров.

Повышение эффективности моделей и ПО может поглотить часть аппаратного давления.

Более совершенная структура модели, более высокий процент попаданий в кеш, более умная диспетчеризация могут снизить повторные вычисления и перенос данных. Некоторые проблемы, которые раньше решались через масштабирование, могут быть смягчены программной оптимизацией.

Расширение поставок так же ослабляет сохранение прибыли.

Даже если один этап выходит в мейнстрим, но мощности освобождаются слишком быстро, конкуренты массово устремляются вперед или продукт быстро стандартизируется, рост доходов может сопровождаться давлением цен.

Большие платформы сами по себе обладают очень сильной переговорной позицией. Они создают спрос и могут удерживать часть добавленной ценности внутри платформы за счет централизованных закупок, собственной разработки и параллельной работы по нескольким маршрутам.

Эти изменения не отменяют основной трек AI-завода — они лишь меняют место, длительность и распределение ценности «узких мест».

Можно считать установленным: одной лишь оценкой AI-мощностей по количеству GPU уже все больше приходит к искажению.

Системная поставка станет более важным водоразделом.

Новая единица измерения AI

На первой фазе расширения AI-инфраструктуры сравнивается, кто способен получить самые дефицитные чипы.

На следующем этапе сравнивается, кто сможет организовать эти чипы в промышленную систему, которая будет стабильно работать.

GPU обеспечивает ключевую вычислительную мощность.

HBM гарантирует, что данные быстро попадают в вычислительные блоки.

Передовая упаковка организует вычисления, память и высокоскоростные соединения в платформу, которую можно поставлять, и продолжает углубляться в сторону повышения выхода годных изделий, тестирования, подложек и оптоэлектронной координации.

Сеть соединяет вычисления в точках в способность к кластерной работе.

Электропитание и охлаждение вводят оборудование в реальную работу.

Память, хранение и диспетчеризация определяют эффективность системы и стоимость каждого инференса.

Эти этапы вместе выполняют финальную трансформацию: из балансовых активов — в способности модели, которые можно постоянно использовать.

Конечная поставка AI-завода — это не просто цепочка из количества GPU и не список грандиозных капитальных затрат.

Они поставляют стабильное время обучения, предсказуемую пропускную способность инференса, допустимую удельную стоимость и эффективные вычислительные мощности, которые могут долго обслуживать реальные потребности.

На первом этапе меряются способностью получать чипы.

На втором этапе меряются системной организацией.

Когда меняется единица измерения, меняются и координаты ценности в цепочке поставок. Следующее, на что стоит обратить внимание, — какие этапы ограничивают способность чипов работать эффективно, какие компетенции уменьшают ожидание, контролируют потери и превращают дорогие инвестиции в реальный выпуск.

Продолжая смотреть дальше по цепочке, первым обычно усиливается то, что связано с сетью.

Чем больше GPU, тем меньше можно игнорировать эффективность соединений.

Следующая статья — про AI-сеть. Модуль оптики — лишь вход; эффективность соединений становится производственной эффективностью AI-завода.