英伟达这次真正厉害的,不只是GPU更快
英伟达这次又把AI基础设施往前推了一步:AI Agent开始自己给AI写“加速器”了。
据NVIDIA Labs披露,内核设计智能体KDAgent已经能够自主优化Moonshot AI的Kimi Delta Attention算子。在B300、8192 tokens测试中,相比官方FlashKDA基线,TIRx版本几何平均加速约2.96倍,CAKE-PTX约2.94倍,CuTe-DSL约2.85倍;同时8K tokens最终状态相对误差从3.45%大幅降至0.22%和0.29%。
这件事真正值得关注的地方,不只是“快了接近3倍”,而是AI正在从调用工具,走向自己优化工具。
以前GPU性能提升更多依赖芯片制程、架构升级和人工CUDA优化;现在模型本身开始参与底层Kernel设计,如果这种能力进一步成熟,未来AI应用迭代速度可能不再完全受制于人工工程师优化周期。
而且Kimi只是一个案例。NVIDIA目前已经持续在Kimi、Blackwell、推理优化和Agentic AI基础设施上投入,官方也在强调tokens/s、tokens/W、cost/token等指标的重要性。
这意味着AI产业链的竞争正在从“谁的GPU更多”,逐渐延伸到“谁能把同一块GPU榨出更多算力”。
对市场来说,这条消息有两层影响:短期利好GPU利用率、AI推理效率和软件优化生态;中长期则可能进一步降低单位Token成本,让更复杂、更长上下文的AI Agent具备商业化条件。
所以真正值得关注的可能不是Kimi这一次快了2.96倍,而是如果AI开始自己优化底层算子,未来GPU的有效算力还能被释放多少?
这可能才是AI算力需求继续增长的另一条隐藏逻辑。
英伟达这次又把AI基础设施往前推了一步:AI Agent开始自己给AI写“加速器”了。
据NVIDIA Labs披露,内核设计智能体KDAgent已经能够自主优化Moonshot AI的Kimi Delta Attention算子。在B300、8192 tokens测试中,相比官方FlashKDA基线,TIRx版本几何平均加速约2.96倍,CAKE-PTX约2.94倍,CuTe-DSL约2.85倍;同时8K tokens最终状态相对误差从3.45%大幅降至0.22%和0.29%。
这件事真正值得关注的地方,不只是“快了接近3倍”,而是AI正在从调用工具,走向自己优化工具。
以前GPU性能提升更多依赖芯片制程、架构升级和人工CUDA优化;现在模型本身开始参与底层Kernel设计,如果这种能力进一步成熟,未来AI应用迭代速度可能不再完全受制于人工工程师优化周期。
而且Kimi只是一个案例。NVIDIA目前已经持续在Kimi、Blackwell、推理优化和Agentic AI基础设施上投入,官方也在强调tokens/s、tokens/W、cost/token等指标的重要性。
这意味着AI产业链的竞争正在从“谁的GPU更多”,逐渐延伸到“谁能把同一块GPU榨出更多算力”。
对市场来说,这条消息有两层影响:短期利好GPU利用率、AI推理效率和软件优化生态;中长期则可能进一步降低单位Token成本,让更复杂、更长上下文的AI Agent具备商业化条件。
所以真正值得关注的可能不是Kimi这一次快了2.96倍,而是如果AI开始自己优化底层算子,未来GPU的有效算力还能被释放多少?
这可能才是AI算力需求继续增长的另一条隐藏逻辑。