На этот раз по-настоящему впечатляет не только то, что GPU стали быстрее у NVIDIA.
NVIDIA снова продвинула вперёд инфраструктуру для AI: AI Agent начинает сам писать для AI «ускорители».
По данным NVIDIA Labs, агент по ядрам KDAgent уже способен автономно оптимизировать оператор Kimi Delta Attention из Moonshot AI. В тестах на B300 при 8192 токенах по сравнению с официальной базовой реализацией FlashKDA версия TIRx показала геометрическое среднее ускорение примерно в 2,96 раза, CAKE-PTX — в 2,94 раза, CuTe-DSL — в 2,85 раза; при этом для финального состояния при 8K токенах относительная ошибка снизилась с 3,45% до 0,22% и 0,29%.
Здесь стоит обратить внимание не только на «ускорение почти в 3 раза», а на то, что AI переходит от вызова инструментов к самостоятельной оптимизации инструментов.
Раньше рост производительности GPU в большей степени зависел от технологического процесса чипов, архитектурных обновлений и ручной оптимизации CUDA; теперь же сама модель начинает участвовать в проектировании низкоуровневых Kernel. Если этот навык будет дальше развиваться, скорость итераций AI‑приложений в будущем может быть уже не так полностью ограничена циклoм оптимизации, зависящим от инженеров.
И дело не только в Kimi. NVIDIA уже последовательно инвестирует в Kimi, Blackwell, оптимизацию инференса и агентную AI‑инфраструктуру. Официально также подчёркивается важность показателей вроде tokens/s, tokens/W и cost/token.
Это означает, что конкуренция в цепочке AI‑производства постепенно смещается от «чей GPU мощнее» к «кто может выжать больше вычислительной мощности из одного и того же GPU».
Для рынка у этой новости два уровня влияния: в краткосрочной перспективе — позитив для утилизации GPU, эффективности AI‑инференса и экосистемы оптимизации ПО; в средне- и долгосрочной — возможно дальнейшее снижение стоимости одного Token, что даст коммерческие условия для более сложных AI Agent с более длинным контекстом.
Поэтому, возможно, важнее не то, что Kimi на этот раз ускорился в 2,96 раза, а то, сколько ещё эффективной вычислительной мощности GPU сможет быть высвобождено, если AI начнёт самостоятельно оптимизировать базовые операторы.
Это, возможно, и есть ещё одна скрытая логика продолжающегося роста спроса на вычислительные мощности AI.
NVIDIA снова продвинула вперёд инфраструктуру для AI: AI Agent начинает сам писать для AI «ускорители».
По данным NVIDIA Labs, агент по ядрам KDAgent уже способен автономно оптимизировать оператор Kimi Delta Attention из Moonshot AI. В тестах на B300 при 8192 токенах по сравнению с официальной базовой реализацией FlashKDA версия TIRx показала геометрическое среднее ускорение примерно в 2,96 раза, CAKE-PTX — в 2,94 раза, CuTe-DSL — в 2,85 раза; при этом для финального состояния при 8K токенах относительная ошибка снизилась с 3,45% до 0,22% и 0,29%.
Здесь стоит обратить внимание не только на «ускорение почти в 3 раза», а на то, что AI переходит от вызова инструментов к самостоятельной оптимизации инструментов.
Раньше рост производительности GPU в большей степени зависел от технологического процесса чипов, архитектурных обновлений и ручной оптимизации CUDA; теперь же сама модель начинает участвовать в проектировании низкоуровневых Kernel. Если этот навык будет дальше развиваться, скорость итераций AI‑приложений в будущем может быть уже не так полностью ограничена циклoм оптимизации, зависящим от инженеров.
И дело не только в Kimi. NVIDIA уже последовательно инвестирует в Kimi, Blackwell, оптимизацию инференса и агентную AI‑инфраструктуру. Официально также подчёркивается важность показателей вроде tokens/s, tokens/W и cost/token.
Это означает, что конкуренция в цепочке AI‑производства постепенно смещается от «чей GPU мощнее» к «кто может выжать больше вычислительной мощности из одного и того же GPU».
Для рынка у этой новости два уровня влияния: в краткосрочной перспективе — позитив для утилизации GPU, эффективности AI‑инференса и экосистемы оптимизации ПО; в средне- и долгосрочной — возможно дальнейшее снижение стоимости одного Token, что даст коммерческие условия для более сложных AI Agent с более длинным контекстом.
Поэтому, возможно, важнее не то, что Kimi на этот раз ускорился в 2,96 раза, а то, сколько ещё эффективной вычислительной мощности GPU сможет быть высвобождено, если AI начнёт самостоятельно оптимизировать базовые операторы.
Это, возможно, и есть ещё одна скрытая логика продолжающегося роста спроса на вычислительные мощности AI.