SK Hynix только что обозначила реальный узкий барьер для ИИ — и теперь это уже не вычисления.
На форуме Dell их вице-президент по архитектуре систем заявил, что пропускная способность памяти теперь определяет общую производительность ИИ больше, чем «сырая» мощность GPU. LLM уже перемещают огромные объёмы данных. Агентные нагрузки и более длинные контекстные окна повышают пропускную способность по токенам с десятков в секунду к сотням или даже тысячам.
HBM быстро масштабировалась от Gen 1 до HBM4, но SK говорит, что этого больше недостаточно для систем следующего поколения с агентными сценариями. Складирование памяти непосредственно на GPU могло бы открыть гораздо более высокую пропускную способность, но тепловые ограничения делают этот путь сложным. Вторая проблема — энергопотребление: большая часть мощности уходит на перемещение данных, а не на вычисления. Именно поэтому исследования по обработке в памяти (processing-in-memory) продолжают активно развиваться.
Мемори-пулинг по CXL разворачивается, чтобы сократить время простоя GPU и улучшить экономическую эффективность. Прирост эффективности в других местах, включая алгоритмические улучшения, последовал парадоксу Джевонса: они увеличили общий спрос на память, а не уменьшили его.
Схема ясна. Вычисления продолжают развиваться. Система всё сильнее упирается в то, насколько быстро и насколько эффективно вы можете поставлять данные. Именно это ограничение формирует следующий виток инвестиций в ИИ-инфраструктуру.
На форуме Dell их вице-президент по архитектуре систем заявил, что пропускная способность памяти теперь определяет общую производительность ИИ больше, чем «сырая» мощность GPU. LLM уже перемещают огромные объёмы данных. Агентные нагрузки и более длинные контекстные окна повышают пропускную способность по токенам с десятков в секунду к сотням или даже тысячам.
HBM быстро масштабировалась от Gen 1 до HBM4, но SK говорит, что этого больше недостаточно для систем следующего поколения с агентными сценариями. Складирование памяти непосредственно на GPU могло бы открыть гораздо более высокую пропускную способность, но тепловые ограничения делают этот путь сложным. Вторая проблема — энергопотребление: большая часть мощности уходит на перемещение данных, а не на вычисления. Именно поэтому исследования по обработке в памяти (processing-in-memory) продолжают активно развиваться.
Мемори-пулинг по CXL разворачивается, чтобы сократить время простоя GPU и улучшить экономическую эффективность. Прирост эффективности в других местах, включая алгоритмические улучшения, последовал парадоксу Джевонса: они увеличили общий спрос на память, а не уменьшили его.
Схема ясна. Вычисления продолжают развиваться. Система всё сильнее упирается в то, насколько быстро и насколько эффективно вы можете поставлять данные. Именно это ограничение формирует следующий виток инвестиций в ИИ-инфраструктуру.