ما الذي يُعدّ إنفيديا هذه المرة بارعًا فعلًا، ليس فقط أن وحدات GPU أسرع
دفعت إنفيديا هذه المرة البنية التحتية للذكاء الاصطناعي خطوة أخرى إلى الأمام: فقد بدأ وكيل AI بكتابة “مُسرّع” لـ AI من تلقاء نفسه.
وفقًا لما كشف عنه NVIDIA Labs، أصبح وكيل تصميم النوى KDAgent قادرًا على تحسين مُشغّل Kimi Delta Attention الخاص بـ Moonshot AI بشكل مستقل. وفي اختبارات B300 و8192 token، وُجد أن إصدار TIRx حقق متوسط تسارع هندسي يقارب 2.96 مرة مقارنةً بخط الأساس FlashKDA الرسمي، و2.94 مرة في CAKE-PTX، و2.85 مرة في CuTe-DSL؛ كما انخفض الفرق النسبي في الحالة النهائية عند 8K tokens من 3.45% بشكل كبير إلى 0.22% و0.29%.
والشيء الذي يستحق الانتباه هنا ليس فقط “أنه بات أسرع بنحو 3 مرات تقريبًا”، بل أن الذكاء الاصطناعي ينتقل من مجرد استدعاء الأدوات إلى تحسين أدواته بنفسه.
في السابق كانت قفزات أداء GPU تعتمد أكثر على تحسينات تصنيع الشرائح، والترقيات المعمارية، وعمليات التحسين اليدوية في CUDA؛ أما الآن فالبنية النموذجية نفسها بدأت تشارك في تصميم kernel على مستوى القاع. وإذا نضجت هذه القدرة أكثر، فقد لا يصبح تطور تطبيقات AI خاضعًا بالكامل لدورات تحسين المهندسين البشريين.
ثم إن Kimi ليست سوى مثال واحد. تعمل إنفيديا حاليًا بشكل مستمر على الاستثمار في Kimi وBlackwell وتحسينات الاستدلال وبنية تحتية لوكلاء الذكاء الاصطناعي (Agentic AI)، كما تُبرز رسميًا أهمية مؤشرات مثل tokens/s وtokens/W وcost/token.
وهذا يعني أن المنافسة في سلسلة صناعة الذكاء الاصطناعي تتحول من “من يمتلك GPU أكثر” إلى “من يمكنه استخراج قدرة حوسبة أكبر من نفس شريحة GPU”.
وبالنسبة للسوق، لهذه الرسالة تأثيران: على المدى القصير إيجابي لتحسين استغلال GPU وكفاءة استدلال AI وبيئة تحسين البرمجيات؛ وعلى المدى المتوسط-الطويل قد يؤدي ذلك إلى خفض تكلفة الـ Token لكل وحدة أكثر، ما يفتح الباب أمام وكلاء AI أكثر تعقيدًا وبسياقات أطول للتسويق تجاريًا.
لذلك ربما ليس الأهم هو أن Kimi أصبحت أسرع بـ2.96 مرة هذه المرة تحديدًا، بل: إذا بدأ AI تحسين المكونات الأساسية (ops) بنفسه، فكم من القدرة الحوسبية الفعّالة لـ GPU يمكن تحريرها مستقبلًا؟
قد تكون هذه هي المنطق الخفي الثاني لنمو الطلب على قدرات الحوسبة الخاصة بالذكاء الاصطناعي.