Вчера на рынке США сектор высоких технологий возобновил рост: Nvidia после семи подряд снижений завершила день ростом более чем на 2%. Lumentum и Coherent прибавили более чем на 6% и 4% соответственно, а Micron и SK hynix выросли примерно на 2,5%. Ключевым катализатором стало то, что OpenAI опубликовала результаты тестирования своей первой собственной ин-ференсной (вычисляющей вывод) микросхемы Jalapeno («огненный острый перец»), где она по нескольким показателям обошла Nvidia GB300. Этот чип разработан OpenAI совместно с Broadcom, использует техпроцесс N3P и оснащён памятью HBM4 (ёмкость до 216 ГиБ). Пропускная способность составляет 15,4 ТБ/с, а основное предназначение — фокус на инференсе. Ранее рынок считал, что это лишь частный чип, созданный под модели GPT, однако фактически это высоко универсальный чип для инференса с полностью открытой архитектурой. На этот раз сравнение проводилось в первую очередь с GB300: в качестве основных ориентиров использовались собственная более компактная открытая модель GPT-OSS 120B, а также сторонние модели DeepSeek, Kimi и другие. Результаты показали, что чип обладает преимуществами по двум метрикам — объёму AI-вычислений, обрабатываемому на единицу энергопотребления, и по скорости ответа.
Результаты тестов наглядно показывают, как меняются правила от обучения к инференсу. Раньше чипы ценили прежде всего абсолютную пиковую вычислительную мощность (FLOPS) — это важно на этапе обучения и здесь у NVIDIA традиционно сильные позиции. Но реальность для OpenAI такова: узкое место в дата-центрах не в том, что нельзя купить чипы, а в том, что не хватает электричества — чтобы построить подстанции, протянуть линии электропередачи и наладить охлаждение, требуются годы. Поэтому главный экономический показатель — сколько Token можно «выжать» на каждый мегаватт электроэнергии. Jalapeno как раз бьет по этой болевой точке: номинальная потребляемая мощность одного чипа — всего 700 Вт (а при тестах с высокой нагрузкой даже ниже 550 Вт), тогда как чипы NVIDIA сопоставимого класса часто 900 Вт и более, а иногда и свыше 1 кВт. На пиковом уровне пропускной способности ее производительность на ватт составляет 1,5–1,9 раза по сравнению с GB200/GB300, что позволяет OpenAI при тех же условиях корпуса и бюджета по электроэнергии обслуживать больше пользователей параллельно и снижать стоимость каждого отдельного запроса. Важно отметить, что она не сравнивалась с самым новым поколением Vera Rubin.
С точки зрения архитектуры Jalapeno использует совместный софт- и хардварный подход: напрямую размещает высокопропускную HBM4 внутри чипа и делает так, чтобы вычислительные ядра в первую очередь обращались к локальной памяти, избегая высокой задержки и энергопотребления при переносе данных между чипами. Кроме того, она не применяет популярную сейчас архитектуру с разделением Prefill/Decode, а «сшивает» все вычислительные мощности и за счет программной динамической диспетчеризации адаптируется к колебаниям трафика в реальном бизнесе. При тестировании Kimi K2.5 пиковая производительность на ватт выросла примерно в 1,5 раза, а сквозная задержка снизилась в 3,4 раза. OpenAI от проектирования до выпуска кристалла потребовалось всего 9 месяцев: ключ — в том, что сначала создают AI-чип, а затем заставляют AI писать драйверный код. В части сложных механизмов внимания и модулей MoE сгенерированный AI код работает быстрее, чем ручная работа экспертов, более чем в 1,5 раза. Команда, не имея готовых ядер, менее чем за две недели завершила высокоуровневую оптимизацию сторонней модели, тем самым доказывая, что в условиях предельных возможностей ИИ «крепость» CUDA-экосистемы NVIDIA не является неприступной.
Объективно в ближайшей перспективе NVIDIA не будет поставлена под сомнение: руководитель чип-подразделения OpenAI прямо заявил, что в ближайшее время не откажется от существующих поставщиков, и отметил: «NVIDIA всё ещё очень хороший партнер». Для NVIDIA право устанавливать цены на инференс может ослабнуть, но барьер для обучения по-прежнему остается прочным. При этом сравнение Jalapeno с GB300 не совсем корректно: настоящим конкурентом выступает следующее поколение Rubin, которое тоже использует HBM4. Тем не менее, как один из крупнейших клиентов NVIDIA, OpenAI имеет собственный чип для инференса, что означает более сильные позиции в будущих переговорах о закупках вычислительных мощностей. Для AMD давление идет не только из-за пиковых объемов вычислений, но и из-за скорости итераций в программной экосистеме и адаптации моделей. Тренд в отрасли становится всё яснее: когда развитие программных алгоритмов достигает определенного масштаба, AI-компании начинают «спускаться» вниз по стеку и интегрировать железо, чтобы найти оптимальный эффект в пересчете на единицу экономики. Google (TPU), Amazon (Inferentia), стартапы и даже OpenAI, которая сама вышла на рынок, — все они бросают вызов NVIDIA с точки зрения затрат, энергоэффективности и специфических сценариев, а определенность со стороны upstream-аутсорсинга и «продавцов воды» для межсоединений остается по-прежнему высокой.