تغير الفاعل في مجال الذكاء الاصطناعي: من شراء وحدات معالجة الرسوميات إلى تسليم مصانع الذكاء الاصطناعي

عندما لم تعد القدرة الحاسوبية في الدفاتر تعادل الإنتاج الحقيقي، فإن ترتيب قيمة سلسلة الصناعة يعاد ترتيبه
في العامين الماضيين، استولت ثلاثة أشياء تقريبًا على سرديات البنية التحتية للذكاء الاصطناعي.
GPU (Graphics Processing Unit، معالج الرسوميات)، وHBM (High Bandwidth Memory، الذاكرة عالية النطاق الترددي)، إضافة إلى التغليف المتقدم.
التقاط هذا الحكم لمس قلب الجولة الأولى من التوسع، كما جعل السوق تدريجيًا يتشكل لديه فهم يكاد يصبح رد فعل تلقائي: كلما زادت الشرائح، زادت القدرة الحاسوبية، وكلما زادت القدرة، زادت الطاقة الإنتاجية.
في الوقت الحالي، بدأ هذا المعادلة يفقد صلاحيتها.
يمكن لوحدات GPU أن تصل وتُسلّم، ويمكن للخوادم أن تدخل المخزن، ويمكن أن تستمر النفقات الرأسمالية في الزيادة، لكن القدرة الحوسبية قد لا تعمل/لا تُشغَّل بالضرورة في الموعد. ويمكن تمامًا لمصنع ذكاء اصطناعي أن يمتلك في الوقت نفسه أغلى الأجهزة، وأيضًا أكثر حالات الانتظار إحراجًا.
انتظار الكهرباء، انتظار التبريد، انتظار الشبكة، انتظار البيانات، انتظار الجدولة.
دخلت الرقائق إلى قائمة الميزانية العمومية، لكن الطاقة الإنتاجية الفعلية ما تزال متروكة لمرحلة البناء والضبط والربط على مستوى النظام. إن خطة الشراء قد تبدو جميلة، لكن عدد العناقيد القادرة على العمل بثبات أقل من المتوقع. تم نشر المعدات رسميًا من ناحية الشكل، لكن معدل الاستخدام والإنتاج لكل وحدة لا يزالان منخفضين.
إن هذا الفجوة/التفاوت يغيّر طريقة قياس صناعة الذكاء الاصطناعي.
تركز مرحلة المنافسة الأولى على: من يستطيع الحصول على المزيد من الرقائق. أما الفارق في المرحلة التالية فيظهر أكثر في: من يستطيع تنظيم الرقائق وتحويلها إلى مصنع ذكاء اصطناعي يعمل بثبات.
الرقاقة تحدد الحد الأعلى نظريًا، والنظام يحدد نسبة تحقيق ذلك.
لا يُحسب أنك فهمت هذه النقطة حقًا حتى تدخل المرحلة التالية من البنية التحتية للذكاء الاصطناعي.
يشرح نقص الرقائق الجزء العلوي من المرحلة
تظل GPU هي الجهاز الأساسي في حوسبة الذكاء الاصطناعي.
يتطلب تدريب نماذج التعلم الكبيرة والاستدلال إنجاز حسابات متوازية ضخمة الحجم، وتقدم GPU أهم قدرات الحوسبة. إن HBM ملتصقة بالمسرّع/المعجّل، وتغذي وحدات الحوسبة باندفاع بيانات عالي النطاق. حتى لو كانت أداء الشريحة قويًا، إذا تعذر وصول البيانات في الوقت المناسب إلى وحدات الحوسبة، ستقع تلك الوحدات أيضًا في حالة انتظار.
يتولى التغليف المتقدم مسؤولية تنظيم شرائح الحوسبة وHBM والاتصالات عالية السرعة في بنية عالية الكثافة. يجب أن تتقارب القدرة الحوسبية وعرض نطاق الذاكرة ومساحة الشريحة واستهلاك الطاقة والتبديد الحراري في النهاية على مستوى طبقة التغليف.
بدون هذه القواعد/الأساسات، لا يمكن الحديث عن مصنع ذكاء اصطناعي.
خلال السنوات الماضية، كانت السوق تتخذ حول مشتريات وحدات معالجة الرسوميات GPU، وحصص HBM، وجداول الإنتاج للتغليف المتقدم أحكامًا تستند إلى أسس واقعية. وعندما يكون أكثر ما ينقص الصناعة هو رقائق الحوسبة عالية المستوى، فمن يحصل على الرقائق يقترب أكثر من حد الطاقة الإنتاجية.
عندها تتركز التناقضات الأساسية في وسائل الإنتاج نفسها.
إذا لم تكن هناك رقائق كافية، حتى لو كانت شروط الشبكة والكهرباء والتبريد لاحقة/ممتازة، فلن يوجد ما يكفي من الأجهزة لتشغيل النظام. إن إيقاع توريد GPU عالية المستوى يمكنه تقريبًا أن يحدد مباشرة خطة تدريب شركات النماذج وسرعة توسع قدرة مقدمي السحابة.
ما زال الإطار القديم صحيحًا، لكن لم يعد يفسر كل المشكلة.
عندما يتدفق المزيد من الأموال والموهبة وموارد سلسلة التوريد إلى طرف الرقائق، تصبح العتبة الأولى تدريجيًا أكثر وضوحًا لدى عدد أكبر من الناس، وتدخل القيود التالية إلى مجال الرؤية. هل يمكن تصنيع الرقائق؟ يظل ذلك مهمًا. بعد أن تُصنع الرقائق، هل يمكن تكوين طاقة إنتاجية قابلة للاستخدام في الوقت المحدد؟ لقد أصبح هذا أيضًا تحديًا مكلفًا وبنفس درجة الصعوبة.
البنية التحتية للذكاء الاصطناعي تتحول من ندرة وسائل الإنتاج إلى التنافس على قدرة تسليم النظام.
إن مصنع ذكاء اصطناعي واحد أعقد بكثير من قائمة مشتريات واحدة
يمكن لقائمة المشتريات أن تخبر الناس كم اشتروا من GPU وكم من الخوادم وكم من الخزائن.
لا يجيب عن متى يمكن لهذه الأجهزة أن تُشغَّل بالكهرباء، ومتى يمكنها أن تتصل لتشكيل عنقود مستقر، ومتى يمكنها أن تستوعب أعباء العمل الواقعية، ومتى يمكنها تقديم خدمات تدريب واستدلال بتكلفة معقولة بشكل مستمر.
من خروج الرقاقة من المصنع إلى إنجاز مهام النموذج فعليًا، توجد سلسلة طويلة في الوسط.
يجب تغليف GPU وHBM في منصات قابلة للتسليم، ثم الدخول إلى بطاقات الواجهة والأجهزة/الخوادم وخزائن الرفوف.
تحتاج الخزائن إلى كهرباء وتبريد كافيين، ويحتاج عدد كبير من العقد إلى التعاون عبر شبكة عالية السرعة. يجب أن يستمر تدريب البيانات وسياقات الاستدلال في التدفق بين الحوسبة والذاكرة والتخزين، ويجب أن تقلل أنظمة الجدولة من الانتظار والازدحام والدوران في الفراغ.
ثم تمر المنظومة كاملة بعمليات مثل التركيب والضبط المشترك واختبار الأحمال وتمرينات التعامل مع الأعطال والقبول/التسلم في الموقع.
أي جزء يتأخر، تنتظر عنده رؤوس الأموال السابقة.
تمت عملية تسليم الرقائق، لكن إمداد الطاقة لهيكل/خزانة الرفوف لم يُجهَّز بعد؛ لذلك لا يمكن للأجهزة إلا أن تبقى في المستودع أو غرفة الخادم. لقد أصبحت الخزائن مُغذّاة بالكهرباء، لكن قدرة التبريد لا تكفي، فلا يستطيع النظام التشغيل لفترة طويلة على حمل كامل. عندما تكون كل قطعة عتاد في مكانها ومع ذلك يحدث ازدحام في الشبكة، ستظل كمية كبيرة من وحدات GPU في انتظار البيانات والمزامنة.
هذه هي الفروق الأهم بين مصنع الذكاء الاصطناعي ومركز البيانات العادي.
يمكن لمراكز البيانات التقليدية استيعاب عدد كبير من الخوادم المستقلة نسبيًا، ومعالجة أحمال التخزين والمواقع وبرمجيات المؤسسات والحوسبة السحابية العامة. يحتاج مصنع الذكاء الاصطناعي إلى أن تتعاون العقد الحوسبية الضخمة حول مهمة تدريب واحدة أو خدمة استدلال واحدة.
متطلبات هذا أعلى بكثير من ناحية كفاءة المزامنة وكثافة القدرة وإدارة الحرارة وعرض نطاق الذاكرة واستقرار التشغيل.
الخادم الواحد قوي، لكن لا يمكن استنتاج قوة العنقود ككل بشكل طبيعي.
كلما زاد عدد العقد، زادت صعوبة تنسيق النظام. يمكن لتأخر الوصلة الجزئية، أو تعطل جهاز واحد، أو حالة شاذة في درجة الحرارة في نقطة ما، أن تبطئ دفعة كاملة من موارد الحوسبة المكلفة.
في الماضي، كان الناس يفهمون القدرة الحوسبية بوصفها مجموع الشرائح والخوادم.
والآن أقرب فهم إلى الواقع هو أن قدرة الذكاء الاصطناعي الحوسبية هي مخرجات نظامية لا تتشكل إلا بعد التغليف والاتصال وتزويد الطاقة والتبريد والتخزين والجدولة.
وصول المعدات يعني أن الأصول قد تشكلت.
التشغيل المستقر وحده يثبت أن الطاقة الإنتاجية قد تشكلت فعليًا.
تتحول القدرة الحوسبية الفعالة إلى مقياس جديد
يصف حساب القدرة في الدفاتر عدد الأجهزة والقمم/الذرى النظرية.
القدرة الحوسبية الفعالة تهتم بكمية ما ينجز فعلاً من تدريب واستدلال مستقر وقابل للجدولة وقابل للاستمرار باستخدام هذه الأجهزة في النهاية.
يمكن لعناقيد GPU بنفس الحجم أن تمتلك مخرجات فعلية مختلفة تمامًا.
في إحدى مجموعات الأنظمة، يؤدي الانتظار المتكرر لاتصالات الشبكة وقراءة البيانات إلى انخفاض استغلال GPU عن المتوقع. وفي مجموعة أخرى، إذا كانت الشبكة والذاكرة والجدولة أكثر نضجًا، فقد تنجز المزيد من المهام في نفس الوقت، حتى بدون تفوق واضح في حجم العتاد.
تبدو الأرقام في الدفاتر متقاربة، لكن القدرات الإنتاجية الفعلية تفصلها فجوة بالفعل.
تشمل القدرة الحوسبية الفعالة على الأقل عدة طبقات من المعنى.
أن تعمل الأجهزة في الوقت المحدد، وأن يتعاون العنقود بكفاءة، وأن تُنجز المهام بشكل مستقر، وأن تكون تكلفة الإخراج لكل وحدة ضمن نطاق يمكن الاستمرار في استخدامه.
المتطلبات التي تقدمها عملية التدريب والاستدلال لهذه المنظومة ليست متطابقة.
أثناء التدريب، يتم عادةً تقسيم نموذج على عدد كبير من وحدات GPU. يجب على العقد المختلفة تبادل البيانات بشكل متكرر وتزامن المعلمات. بمجرد أن تصبح بعض العقد بطيئة، ستنتظر العقد الأخرى أيضًا.
هذه الانتظارات لا تظهر في الأداء النظري للرقائق، لكنها تظهر مباشرة في مدة التدريب، وفاتورة الكهرباء، وكفاءة استخدام المعدات، وتكلفة الهندسة.
أما الاستدلال فيواجه مجموعة أخرى من الضغوط.
ينطلق المستخدمون الحقيقيون باستمرار بإرسال الطلبات، ويحتاج النظام إلى البدء بالاستجابة خلال وقت قصير نسبيًا، والحفاظ على الاستقرار في ظروف التوازي/التزامن العالي.
تطول السياقات أكثر فأكثر، وتصبح التفاعلات متعددة الجولات أكثر شيوعًا. يبدأ الوكلاء/العملاء (agents) باستدعاء الأدوات وتنفيذ مهام أكثر تعقيدًا، ويحتاج النظام إلى حفظ واستدعاء متكرر لكم كبير من الحالات الوسيطة.
تتطور KV cache (Key-Value cache، ذاكرة القيم/المفاتيح) تدريجيًا من مجرد تفاصيل تقنية إلى جزء مهم من تكاليف الاستدلال.
ستشغل هذه الحالات الوسيطة ذاكرة عرض/显存 (ذاكرة GPU) مكلفة، كما ستؤثر على الذاكرة والتخزين والشبكة والجدولة.
إذا تم وضع كل شيء داخل HBM فقط، تكون التكلفة مرتفعة جدًا. وإذا انتقل إلى الذاكرة العادية أو التخزين، فستزيد تأخيرات الوصول. يجب على النظام أن يتخذ باستمرار قرارات مفاضلة بين السرعة والسعة والتكلفة.
لذلك تصبح تكلفة كل token (رمز/وحدة) مؤشرًا أكثر أهمية.
تكلفة token واحدة يحددها في النهاية معًا: شرائح الحوسبة والذاكرة والشبكة والتخزين والكهرباء والتبريد وكفاءة البرمجيات. GPU هي مجرد الجزء الأغلى والأوضح بينها.
إذا لم يتم إرسال البيانات إلى GPU في الوقت المناسب، فستدور الأجهزة المكلفة دون إنتاج فعلي.
إذا حدث اختناق في الشبكة، سيتدهور كل من إنتاج الاستدلال وزمن الاستجابة.
إذا كانت كفاءة إدارة الكاش منخفضة جدًا، فسيتم ملء ذاكرة العرض/显存 بسرعة.
إذا كانت قدرة التبريد غير كافية، لا يمكن للمعدات الحفاظ على حمل مرتفع.
إذا كان التعافي من الأعطال بطيئًا، فقد تُبطئ مشكلة جزئية واحدة مجموعة كاملة من المهام.
هذه التفاصيل التي تبدو كأنها أعمال هندسية في غرفة الخادم في النهاية تنتهي كلها إلى نتيجة تجارية واحدة.
بنفس مقدار الاستثمار الرأسمالي، كم عدد قدرات النماذج المستقرة التي يمكن إنتاجها فعليًا؟
كلما كبر الحجم، أصبحت نقاط ضعف النظام أغلى
يمكن للعناقيد صغيرة الحجم أن تُخفي كثيرًا من المشكلات عبر التكرار (ال redundancy) والتدخل اليدوي.
بعد توسع الحجم، ستتحول المشكلات الجزئية بسرعة إلى مشكلات نظامية.
زيادة عقد الحوسبة لا تجعل المخرجات تنمو تلقائيًا بنسبة مماثلة. كلما زادت العقد، ازدادت تعقيدات الاتصال والمزامنة، وتكاثرت نقاط الأعطال.
سترتفع كثافة القدرة والحرارة وضغط التوصيلات/التجهيزات، وستبدأ تكاليف التنسيق داخل النظام في ابتلاع جزء من الزيادة في العتاد.
وهذا أيضًا سبب انتقال الشبكة إلى الواجهة الأمامية في وقت مبكر.
يمكن لبطاقة GPU واحدة أن تنجز بعض المهام بشكل مستقل، لكن تدريب نماذج التعلم العميق يعتمد على تعاون واسع النطاق.
تحتاج العقد إلى تبادل البيانات بسرعة وثبات. يؤدي أي تراجع بسيط في كفاءة الاتصال إلى أن تقضي أجهزة الحوسبة المكلفة وقتًا أطول في الانتظار.
ما زالت إضافة وحدات GPU تزيد القدرة الحوسبية النظرية، لكن المخرجات الجديدة لا تنمو بالتزامن.
القيود التي يجلبها عامل الكهرباء تصبح أكثر مباشرة.
إن حصول مركز البيانات على الأرض وخطط الكهرباء لا يعني أن الطاقة الكهربائية قد دخلت بالفعل إلى الرفوف/الخزائن.
السعة يجب أن تمر كذلك عبر الربط بالشبكة، والتحويل بالجهد الكهربائي، والتوزيع داخل الموقع، وإمدادات الطاقة الاحتياطية، والحافلات، وتحويل الطاقة داخل هيكل/خزانة الرف. أي تأخير في أي حلقة يؤدي إلى تأخير تشغيل الأجهزة.
بعد دخول الكهرباء إلى الرقاقة/الشرائح، تتحول تقريبًا كلها إلى حرارة.
مع استمرار ارتفاع قدرة خزانة واحدة/رف واحد، أصبح الحيز الذي يمكن أن يدعمه التبريد الهوائي التقليدي أضيق تدريجيًا.
بدأ التبريد بالسائل بالانتقال من كونِه تجهيزًا داعمًا لغرف الخادم إلى تصميم الخوادم والخزائن، وتأثيره يمتد أكثر إلى خطوط الأنابيب وتوزيع سائل التبريد وإجراءات الصيانة وتخطيط غرفة الخادم والقبول/التسلم في الموقع.
لذلك تغيّر معنى حلول التبريد.
لن يقتصر التأثير على حرارة الرقاقة فحسب، بل سيغير كذلك موعد تسليم المشروع، ومن يتحمل مسؤولية الأعطال، وكيف تُصان المعدات، وهل يمكن للخزائن الحفاظ على حمل مرتفع لفترة طويلة.
بعد توسع الاستدلال، تمتد ضغوط النظام أكثر نحو الذاكرة والتخزين.
تنتج السياقات الطويلة والمحادثات متعددة الجولات ومهام الوكلاء مزيدًا من الحالات.
يحتاج النظام إلى تحديد ما الذي يُبقيه في الذاكرة عالية السرعة (ذاكرة العرض المؤقتة عالية السرعة)، وما الذي ينقله إلى الذاكرة العادية، وما الذي ينتقل إلى التخزين المحلي أو الشبكي، وأي كاش يمكن إعادة استخدامه عبر طلبات متعددة.
بدأت المنافسة على القدرة الحوسبية بالانتقال من أداء الشريحة الواحدة إلى ترتيب البيانات وجدولة الموارد.
لا تظهر هذه القيود بالضرورة بالتتابع وفق جدول زمني مرتب. ستواجه منصات مختلفة، وأحمال مختلفة، وغرف خادم مختلفة، نقاط ضعف مختلفة في الوقت نفسه.
تجعل عناقيد التدريب أكثر سهولة في كشف مشكلات الشبكة وتحمل نقل البيانات.
تجميع الاستدلال يجعل من السهل كشف مشكلات ذاكرة السياق، وزمن الاستجابة، والتكلفة لكل وحدة.
ستواجه غرف الخوادم عالية القدرة ضغوطًا على الإمداد بالكهرباء والتبريد في وقت أبكر.
الاتجاه المشترك أصبح واضحًا جدًا. كلما كان حجم الرقاقة أكبر، زادت الأجزاء/الملحقات المخبأة في الخلفية التي كانت سابقة الذكر والتي ستدخل في دالة الإنتاج. كما ستصبح نقاط الضعف في النظام أكثر تكلفة بشكل متزايد.
تبدأ قصة التغليف المتقدم بالتحرك نحو أعمق
لم يُضعف دخول الشبكة والكهرباء والتبريد بالسائل إلى الواجهة الأمامية أهمية التغليف المتقدم.
لا يزال التغليف المتقدم قيدًا أساسيًا لمصنع الذكاء الاصطناعي، لكنه أيضًا يدخل مرحلة جديدة من التطور.
التركيز في المرحلة الأولى هو على الطاقة الإنتاجية.
يتوسع تغليف/شرائح الذكاء الاصطناعي عالية المستوى بسرعة، وتحتاج شرائح الحوسبة وHBM إلى تشكيل روابط عالية الكثافة من خلال تغليف معقد.
الجدولة المتاحة محدودة، وسرعة التوسع في الطاقة الإنتاجية تؤثر مباشرة في تسليم الرقائق. لذلك يركز السوق بشدة على من يمتلك المزيد من القدرة، ومن يمكنه التوسع بشكل أسرع.
بدأت صعوبة المرحلة الثانية بالانتقال إلى ما هو أعمق: الغَلَة (معدل الإنتاج المقبول)، والاختبار، واللوح/الركيزة (基板)، وإدارة الحرارة، والتعاون الكهروضوئي، وتسليم النظام.
بعد ارتفاع التعقيد، لم يعد بإمكان وصف الطاقة الإنتاجية الاسمية أن يصف بدقة العرض الحقيقي كاملاً.
في تغليف ذكاء اصطناعي عالي المستوى واحد، قد يتم وضع عدة رقائق حوسبة، وعدة تكديسات من HBM، وطبقات وسيطة أكبر، وروابط اتصال سريعة أكثر كثافة. ترتفع قيمة المنتج بسرعة، ويتضخم أيضًا أثر تكلفة أي عيب موضعي.
إذا كانت هناك مشكلة في شريحة/رقاقة واحدة، فقد لا يقتصر الخسار على شريحة واحدة فقط.
يمكن كذلك أن تُهدر HBM والطبقات الوسيطة والركائز وساعات عمل الأجهزة وموارد الاختبار التي تتغلف معها.
كلما كانت قيمة التغليف أعلى، زادت الحاجة إلى تحديد الرقائق العارية المعيبة في وقت أبكر. وزادت أيضًا الحاجة إلى إجراء اختبارات نظامية أكثر تعقيدًا بعد اكتمال التغليف.
تسوية/جدولة الإنتاج (الـ排产) تعالج مسألة: كم يمكن إنجازه.
يحدد معدل الغَلَة والاختبار كم يمكن تسليمه فعليًا.
لذلك سيرتفع موقع الاختبارات المتقدمة باستمرار. إن تكديس عدة رقائق عارية مع HBM يجعل مجموع العيوب أكثر تعقيدًا، ولا تكفي اختبارات الخروج/الفحص التقليدية من المصنع.
يؤثر انتقاء الرقاقة/الدي-سكرِنج (الويفر/الشرائح العارية)، والاختبار بعد التغليف، واختبار التقادم، والدورات الحرارية، والتحقق على مستوى النظام جميعها في جودة التسليم النهائية.
تنتقل الركيزة/اللوح أيضًا من الخلفية إلى الواجهة الأمامية.
مع توسع مساحة التغليف وارتفاع كثافة الخطوط، تزداد متطلبات تسطيح الركيزة والتحكم في الالتواء/الاعوجاج واستقرار المواد وقدرات التوريد. تبدو الركيزة وكأنها مجرد بنية داعمة، لكنها في الواقع هي التي تحدد ما إذا كان يمكن لوصل الشرائح المعقدة أن يرتبط بشكل ثابت، وما إذا كان يمكن التحكم في إجهادات الحرارة، وما إذا كان بالإمكان الدخول في الإنتاج على نطاق واسع.
سيؤدي التعاون الكهروضوئي إلى دفع التغليف إلى طبقة أخرى من التعقيد.
عندما تدفع مسارات مثل CPO (Co-Packaged Optics، البصريات المُعبأة معًا) محرك الضوء إلى مكان أقرب إلى شريحة التبديل، يجب إعادة تنظيم كل شيء: مصدر الليزر، ووصلات الألياف، والمحاذاة البصرية، وإدارة الحرارة، والموثوقية وأساليب الصيانة.
وبالتالي تتسع حدود التغليف أكثر.
إنها لا تتصل بالشرائح المنطقية والذاكرة فقط، بل ستتصل تدريجيًا بالحوسبة وإدخال/إخراج البيانات والاتصال البصري وإدارة التبريد وصيانة النظام.
بالطبع سيستمر التغليف المتقدم في توسيع الطاقة الإنتاجية، لكن الجزء الذي يستحق إعادة تقدير أكبر في المستقبل قد لا يعود مركزًا على الطاقة الإنتاجية الاسمية بحد ذاتها.
ستحصل على وزن صناعي أعلى القدرات التي تحدد ما إذا كان التغليف المعقد يمكن إنتاجه بكميات كبيرة بشكل مستقر، وما إذا كان يمكن تقليل الفاقد، وما إذا كان يمكن تسليم المنتجات في الموعد المحدد.
الاختبارات المتقدمة، والركائز عالية المستوى، وأجهزة القياس، والمواد الحرجة، والمحاذاة البصرية، والتصميم الحراري، والتحقق على مستوى النظام—كلها يمكن أن تصبح مناطق قيمة مهمة للمرحلة الثانية من التغليف المتقدم.
لم يغادر التغليف المتقدم المسار الرئيسي.
إنه ينتقل من قصة الطاقة الإنتاجية الأكثر لفتًا للنظر إلى مراحل أدق وأصعب في التقليد، والأقرب إلى التسليم الحقيقي.
ستتجمع قيمة الصناعة حول قدرات التسليم
عندما ينتقل مقياس الذكاء الاصطناعي من عدد الأجهزة إلى القدرة الحوسبية الفعالة، فإن ترتيب قيمة سلسلة الصناعة سيتغير أيضًا.
الشبكة والكهرباء والتبريد بالسائل والذاكرة والتخزين والشرائح المخصصة والتغليف المتقدم—يبدو أنها تنتمي إلى صناعات مختلفة. الآن يتم ربطها كلها بواسطة نفس المشكلة.
من يستطيع تحويل قدرات الرقائق إلى مخرجات نظامية مستقرة؟
كانت الشبكة في الماضي تتحمل أكثر وظيفة نقل البيانات. بعد توسع حجم العنقود، بدأت تؤثر مباشرة في كفاءة التدريب وإنتاج/خروج الاستدلال وكفاءة استخدام GPU.
كانت الكهرباء في السابق شرطًا خلفيًا لمراكز البيانات. بعد ظهور خزائن/خوادم بقدرة عالية، بدأت مدة توصيل الكهرباء والتوزيع داخل الموقع تحددان متى يمكن للمشروع أن يبدأ التشغيل.
كان يُنظر إلى التبريد في السابق بوصفه جهازًا مخصصًا/مرافقًا.
بعد دخول التبريد بالسائل إلى تصميم الخوادم وخزائن الرفوف، يبدأ تأثيره على تصميم كامل الخزانة، وعلى مدة التسليم، وعلى مسؤوليات الصيانة.
كانت الذاكرة والتخزين في الماضي تُقاسان أكثر بالسعة. وبعد زيادة أحمال الاستدلال، أصبحتا تشاركان بشكل متزايد في سرعة الاستجابة وإعادة استخدام الكاش والتكلفة لكل وحدة.
كان التغليف المتقدم يُعرَّف في الماضي بشكل رئيسي من خلال توسيع الطاقة الإنتاجية والجدولة. الآن تُعاد إعادة توزيع قيمة هذه العناصر: معدل الغَلَة والاختبار والركائز والتعاون على مستوى النظام.
ستتطور الشرائح المخصصة أيضًا وفق منطق مماثل.
معنى ذلك لا يقتصر على تقديم خيار شريحة إضافي فحسب، بل هو—مستهدفًا الأحمال المستقرة—تنظيم الحوسبة والذاكرة والشبكة وجدولة البرامج بشكل أكثر إحكامًا، وبالتالي خفض تكلفة الإخراج لكل وحدة.
لن تؤدي هذه التغييرات إلى استفادة جميع الموردين ذوي الصلة بالتساوي.
يُظهر نمو النفقات الرأسمالية أن هناك طلبًا موجودًا، لكنه لا يثبت أن الأرباح ستُوزع بالتساوي. إصدار المعايير لا يعني إلا أن المسار حاز على قبول، وما زالت توجد مسافة طويلة جدًا على الطريق الهندسي قبل النشر على نطاق واسع.
تُظهر النماذج الأولية والتصاميم المرجعية القدرات التقنية، لكن إيرادات الإنتاج على نطاق واسع لا تزال تمر عبر اعتماد العملاء والتكييف في الموقع والتسليم المستقر.
بعد دخول الصناعة هذه المرحلة، غالبًا لا تكون أغلى القدرات هي تلك ذات أكثر المعلمات لفتًا للنظر.
تتجلى في ما إذا كان بالإمكان تسليم الطلبات في الموعد، والتحكم في معدل الغَلَة، واجتياز اعتماد العملاء، وحل واجهات النظام، وتحمل مسؤوليات الصيانة في الموقع والقبول/التسلم.
قد يتفوق أداء مكوّن واحد، لكن العميل لا يتبناه بالضرورة فورًا.
حتى لو كانت مجموعة حلول ناضجة لا تُعدّ بمستوى عدواني من ناحية المعاملات، فإنه ما دام توفيرها مستقرًا، وصيانتها سهلة، ويمكن تشغيلها في الوقت المحدد، فقد تحتفظ بموقع صناعي قوي جدًا.
وهذا أيضًا المكان الذي يسهل فيه إساءة فهم انتقال حوض الأرباح في الجولة التالية.
مساحة الطلب كبيرة، لا يعني ذلك تلقائيًا أن هامش الربح سيتحسن.
دخول المنتج إلى سلسلة توريد الذكاء الاصطناعي لا يعني امتلاك سلطة تسعير.
نمو الشحن لا يعني بالضرورة أن القيمة ستبقى في يد المورد.
الأقرب إلى حوض الأرباح هي القدرات التي تتحمل مسؤولية التسليم، وتخفض فاقد النظام، وتكون صعبة الاستبدال سريعًا.
لا تبقى قيمة الصناعة محصورة في أكثر المصطلحات رواجًا.
سينتقل إلى الأماكن الأصعب في الحل، والأقرب إلى المخرجات، والأكثر قدرة على إبطاء السلسلة بأكملها.
سيخضع هذا الاتجاه للتكرار والتبديل عدة مرات
يتجه مصنع الذكاء الاصطناعي نحو هندسة الأنظمة، والاتجاه واضح. الإيقاع لن يكون خطًا مستقيمًا.
قد تعود GPU وHBM والتغليف المتقدم إلى أن تكون الاختناقات المطلقة الأقوى. طالما أن إمداد الطرف العلوي سيصبح مرة أخرى أكثر ضيقًا، ستعود انتباه السوق إلى وسائل الإنتاج نفسها.
تؤثر النفقات الرأسمالية لدى مزودي السحابة وشركات النماذج على السلسلة كاملة. بمجرد أن يتباطأ إيقاع البناء، ستتغير أيضًا الشبكة والكهرباء والتبريد بالسائل ومشاريع مراكز البيانات.
تحسين كفاءة النموذج والبرمجيات ستمتص جزءًا من ضغط العتاد.
يمكن للهياكل الأفضل للنماذج، ومعدلات نجاح الكاش الأعلى، وجدولة أذكى أن تقلل الحسابات المكررة ونقل البيانات. وقد تُخفف التحسينات البرمجية بعض المشكلات التي كانت ستُحل سابقًا عبر التوسع في الموارد.
تؤدي توسعة الإمداد أيضًا إلى إضعاف الاحتفاظ بالأرباح.
قد يترافق نمو الإيرادات مع ضغط على الأسعار حتى لو دخلت عملية ما إلى الخط الرئيسي وحدها، طالما تم إطلاق الطاقة الإنتاجية بسرعة كبيرة، أو اندفعت المنافسون بكثرة، أو تم توحيد المنتج بسرعة.
تمتلك المنصات الكبيرة نفسها قدرة تفاوض/مساومة قوية جدًا. فهي لا تخلق الطلب فقط، بل يمكنها أيضًا احتجاز جزء من القيمة المضافة الجديدة داخل المنصة عبر المشتريات المجمعة والتصميم الذاتي وتشغيل مسارات متعددة بالتوازي.
لن تلغي هذه التغييرات المسار الرئيسي لمصنع الذكاء الاصطناعي، بل ستغير مكان ظهور عنق الزجاجة ومدة استمراره وتوزيع القيمة.
يمكن التأكد من أن الاعتماد وحده على عدد وحدات GPU للحكم على طاقة إنتاج AI أصبح يقترب أكثر فأكثر من التشويه/اللاواقعية.
سيصبح تسليم النظام نقطة فاصلة/مفصلية أكثر أهمية.
وحدة قياس جديدة للذكاء الاصطناعي
في التوسع الأول للبنية التحتية للذكاء الاصطناعي، تمت المقارنة على من يستطيع الحصول على أكثر الرقائق ندرة.
في المرحلة التالية، تتم المقارنة على من يستطيع تنظيم هذه الشرائح لتصبح منظومة صناعية تعمل باستمرار.
توفر GPU القدرة الحوسبية الأساسية.
تضمن HBM وصول البيانات بسرعة إلى وحدات الحوسبة.
يحوّل التغليف المتقدم الحوسبة والذاكرة والاتصال عالي السرعة إلى منصة قابلة للتسليم، ويستمر في تعميق الاهتمام بمعدل الغَلَة والاختبار والركائز والتعاون الكهروضوئي.
الشبكة تربط الحوسبة في نقاط منفردة لتكوين قدرة العنقود.
الكهرباء والتبريد هما ما يضمن تشغيل الأجهزة فعليًا.
الذاكرة والتخزين والجدولة تحدد كفاءة النظام، وكذلك تكلفة كل عملية استدلال.
تنجز هذه المراحل معًا التحويل الأخير، فتصبح الأصول في الدفاتر قدرات نماذج يمكن استخدامها باستمرار.
التسليم النهائي لمصنع الذكاء الاصطناعي ليس مجرد سلسلة من أعداد وحدات GPU، ولا قائمة ضخمة من النفقات الرأسمالية.
إنه يسلّم وقت تدريب مستقر، وإنتاج استدلال يمكن التنبؤ به، وتكلفة لكل وحدة يمكن تحملها، وقدرة حوسبية فعالة تخدم الاحتياجات الواقعية على المدى الطويل.
في المرحلة الأولى تتم المقارنة على قدرة الحصول على الرقائق.
المرحلة الثانية تقارن قدرة تنظيم النظام.
عندما تتغير وحدة القياس، تتغير أيضًا إحداثيات قيمة سلسلة الصناعة. الخطوة التالية الأكثر جدارة بالتركيز هي: ما هي المراحل التي تقيد أداء الرقائق؟ وما هي القدرات التي تقلل الانتظار وتتحكم في الفاقد وتحول استثمار العتاد المكلف إلى مخرجات حقيقية.
تابع النظر على طول هذه السلسلة، وغالبًا ما يكون أول ما يُضخم تأثيره هو الشبكة.
كلما زاد عدد GPU، زادت المستحيلات/تعذر تجاهل كفاءة الاتصال.
المقال التالي سيتناول شبكة الذكاء الاصطناعي. وحدة الليزر/الوحدات الضوئية (الليزر/الوحدات) ليست سوى مدخل، وكفاءة الاتصال أصبحت تتحول إلى طبقة كفاءة الإنتاج لمصنع الذكاء الاصطناعي.
