في غرفة الخوادم، كل الأضواء في صفوف متراصة مضاءة.
الخوادم ليست معطوبة، والمراوح تدور كالمعتاد، والكهرباء تستهلك كالمعتاد. على الورق، وصلَت وحدات الـGPU المقررة (معالجات الرسومات)، وتم تجهيز الآلات التي كان يجب تركيبها. لكن مهام التدريب لا تزال لا تعمل بسرعة؛ وخدمات الاستدلال أحيانًا بطيئة بشكل غريب.
ماذا تفعل الآلة؟
في انتظار....
بانتظار أن تنجز عقد أخرى العمل، وبانتظار مزامنة حالة النموذج، وبانتظار مرور البيانات عبر المسار المزدحم. وبانتظار أن تلحق خادمٌ ما تأخر لحظات عن الركب. غالبية وحدات الـGPU أنهت ما عليها من عمل بالفعل، لكن طالما لم تصل بعض العقد القليلة، فسيتعين على المهمة بأكملها أن تتوقف هناك.
أداء GPU واحدة يمكن كتابته بوضوح في جدول المواصفات.
كم يمكن لـ 10,000 GPU أن تنتج؟ لا يمكن ضرب رقم بطاقة واحدة في 10,000.
كلما زادت الأجهزة، زادت الأمور التي يجب أن تتفق عليها فيما بينها. عندما تصبح قطعة من الوصلة بطيئة، وعندما تسدّ حركة المرور في مكان ما، تضطر الشريحة الغالية إلى الجلوس هناك، تواصل استهلاك الكهرباء، تواصل توليد الحرارة، وتواصل الانتظار.
هذه التكلفة لا تبدو بارزة عادةً، لكنها في النهاية تلتهم الإنتاج الحقيقي لمصنع AI خطوة بخطوة.
مصنع AI المقصود هنا ليس مجرد غرفة مليئة بـ GPU. بل هي منظومة تجمع الحساب والذاكرة والشبكة والطاقة والتبريد والجدولة في حزمة واحدة، تنتج باستمرار قدرات التدريب والاستدلال.
الشرائح تحدد الحدّ النظري، بينما المنظومة كاملة تحدد كم من القدرة يمكن استخدامه فعليًا.
فهم شبكات AI ينبغي أن يبدأ من هنا.
عندما كان الناس يتحدثون عن شبكات AI في الماضي، كان أكثر ما يخطر في البال هو الوحدات الضوئية.
من 400G إلى 800G، ثم إلى 1.6T، تزداد السرعة عامًا بعد عام، كما ينخفض استهلاك الطاقة لكل نقل بيانات. الوحدات الضوئية فعلاً هي الطبقة التي تُنفّذ أولًا على شكل طلبات وتسليمات في الوقت الحالي.
لكنّها تجيب أساسًا عن سؤال واحد: في أي مدى يمكن لقطعة من مسارٍ شبكي أن تنقل البيانات بأقصى سرعة؟
لكنها لا تستطيع الإجابة عن سلسلة أخرى أكثر خطورة:
كيف ينبغي أن تسير حركة المرور في كامل العنقود؟
من يبدأ أولًا ومن يتأخر؟ أي طريق يزدحم، وهل يمكن تبديله في الوقت المناسب؟ وكيف تُوصَل الخوادم بالشبكة؟ إذا حدث تذبذب قصير في نقطة ما، لماذا يمكن أن يبطئ آلافًا مؤلفة من بطاقات GPU؟ خدمة الاستدلال تبدو أنها متوسطة السرعة لا بأس بها، فلماذا توجد دائمًا دفعة صغيرة من الطلبات بطيئة بما يكفي لتُقلق؟
عندما تبدأ هذه الأسئلة بالتحكم في استغلال GPU، تتجاوز الشبكة الحد القديم المسمى «مرفق النقل».
إنها أصبحت بالفعل في طبقة كفاءة الإنتاج لمصنع AI.
الوحدة الضوئية ما تزال مهمة.
فقط خلف الباب؛ لم يعد مجرد ممر بسيط.
10,000 GPU ليست 10,000 آلة كلٌ يعمل وحده
الحساب على الكمبيوتر الشخصي غالبًا ما يتم داخل جهاز واحد.
المعالج والذاكرة والتخزين متقاربة جدًا، والبيانات تتحرك ذهابًا وإيابًا بين اللوحة الأم والاتصالات الداخلية. الطريق قصير، والعلاقات بسيطة نسبيًا.
لا توجد بيئة مريحة بهذه السهولة بالنسبة لعنقود AI الكبير.
النموذج كبير جدًا بحيث لا يمكن لـ GPU واحدة أن تستوعبه؛ البيانات كثيرة جدًا بحيث لا يمكن لخادم واحد أن يحسبها بالكامل. يجب تفكيك النموذج، وتفكيك البيانات، وتفكيك المهمة أيضًا، ثم توزيعها على خوادم مختلفة وخزائن مختلفة، بل وحتى على عدد كبير من المسرعات في مبانٍ مختلفة.
بعض GPU تعالج بيانات مختلفة، وبعضها يعالج أجزاء مختلفة من النموذج، وبعض الأجهزة الأخرى تتحمل التخزين أو الشبكة أو الجدولة.
هي تعمل في الظاهر كلٌ لوحده، لكن في الواقع يجب أن تتحدث في كل لحظة.
تبادل البيانات، وتبادل النتائج الوسيطة، وتبادل تحديثات المعلمات، وتبادل حالة النموذج.
هذا النوع من الاتصالات ليس «تسليم واجب» مرة واحدة عند انتهاء المهمة. بل هو ضمن حلقة الحساب: يحسب لبرهة، ويتبادل لبرهة، ثم يكمل الحساب.
في التدريب الموزع، يُعد AllReduce (الاتصال ذو التسوية الشاملة) من العمليات الشائعة جدًا، وهو مثال نموذجي: تخرج كل عقدة حساب بنتيجتها المحلية أولًا، ثم يقوم النظام بتجميعها، وبعدها يرسل النتيجة المتطابقة إلى جميع العقد. وفي التدريب المتزامن، لا يمكن للجولة التالية من الحساب أن تبدأ إلا بعد اكتمال هذه المزامنة. وثائق NCCL الخاصة بـNVIDIA تُعرّف هذه العملية بوضوح.
تبدو هذه القضية كأنها هندسة شبكات، لكنها في الواقع دخلت مرحلة الحساب.
GPU مسؤولة عن الحساب.
الشبكة مسؤولة عن توصيل هذه الحسابات ببعضها.
إذا لم يستطع أي طرف اللحاق، فإن المهمة كلها ستتأثر.
لذلك، تكون عنقودات GPU واسعة النطاق أقرب إلى حاسوبٍ عملاق تُبسط داخله لا نهائية من الخوادم والخزائن. الشبكة ليست مجرد ملحق موضوع خارج هذا الحاسوب؛ بل جزء من الربط الداخلي.
الترابط قصير المدى داخل الخزانة ليس القضية نفسها مقارنة بالشبكات الخلفية عبر الخزائن أو عبر المناطق. الأولى تسعى إلى زمن تأخر منخفض جدًا وكثافة عالية جدًا، بينما الثانية يجب أن توازن بين التوسع والتسامح مع الأعطال والتمديد والصيانة. ومع إطالة المسافة، يتراكم استهلاك الطاقة والمسارات والأعطال والجدولة طبقة فوق طبقة.
وهذا يفسر سبب أن بناء منصات كبيرة لبناء عنقود AI لا يمكن أن ينتظر اكتمال شراء الخوادم للشبكة ثم يكملها ببطء لاحقًا.
الطوبولوجيا، وأجهزة التبديل، وواجهات الشبكة، والتحكم في المرور، والمكدس البرمجي—كل ذلك يجب تصميمه مع GPU والذاكرة والخزائن.
أعلنت Meta عن بناء شبكة RoCE (الوصول المباشر للذاكرة عن بُعد عبر Ethernet مُدمج). وقد انتقلت الأنظمة ذات الصلة من النماذج الأولية إلى عدة عنقودات إنتاج، وتضم كل منها آلاف بطاقات GPU وتستعمل في مهام تدريب مثل التوصيات وفهم المحتوى ومعالجة اللغة الطبيعية وتوليد AI. وبالنسبة للنقاشات الهندسية، فإن المحور لم يعد «هل الوصلة سريعة بما يكفي» فقط، بل أيضًا ما إذا كانت الطوبولوجيا والتوجيه ونقاط النهاية والتحكم في الازدحام والجدولة قادرة على الحفاظ على استقرار مهام الإنتاج. المواد المنشورة لفريق مهندسي Meta تعرض هذا التغير بوضوح شديد.
الإشارة أصبحت واضحة بما يكفي:
تنافس شبكات AI ينتقل من السؤال: هل توجد وصلات عالية السرعة؟ إلى: هل يمكن جعل كامل العنقود يعمل بثبات وهدوء؟
حتى لو كان الطريق واسعًا، فإنه سيظل يزدحم عند تقاطع واحد
عرض النطاق يُفهم جيدًا.
كلما كان الطريق أعرض، زادت السيارات التي يمكنها المرور في الوقت نفسه. كلما ارتفع معدل المنفذ، زادت—نظريًا—البيانات التي يمكن نقلها.
المشكلة هي أن عرض الطريق لا يعني أن الطريق بأكمله سالك.
حتى لو شُقّت طريقات واسعة في مدينة، فإن الازدحام سيحدث إذا تدفقت كل المركبات إلى تقاطع واحد في نفس الدقيقة. حادث صغير أمام الطريق، أو ضبط الإشارات المرورية بشكل غير مناسب، أو اعتقاد الجميع أن طريقًا واحدًا هو الأسرع—كل ذلك قد يؤدي إلى فراغ جهة واحتباس جهة أخرى لا تتحرك.
حركة المرور في عنقود AI ليست مريحة دائمًا للانضباط.
قد تُكمل كثير من العقد جولة حساب في أوقات متقاربة، ثم ترسل البيانات في نفس اللحظة. المرور لا يأتي بسلاسة، بل اندفاع مجموعات تقود بعضها بعضًا. في الوصف العلني الخاص بأحمال شبكة AI لدى Google، تسمى هذه النمطية «التفجرات المتزامنة»: تعاون عدد كبير من العقد في إطلاق مرور عالي الكثافة خلال نطاق من الميلي ثانية، ويكون النظام شديد الحساسية لتذبذب التأخير. وتؤكد وثائق Google Cloud أيضًا أن المراقبة التقليدية منخفضة التواتر غالبًا لا تستطيع رؤية هذه الـmicrobursts.
في هذا الوقت، يكون عرض النطاق للذروة مجرد شرطٌ أدنى.
إلى أين تسلك البيانات، وأي طريق يُسدّ أولًا، وكيف نُفرغ الازدحام بعد أن يحدث، وهل ستتعارض المهام المختلفة على المسار، وهل سيضغط تيار مرور كبير على طلبات أخرى—هذه الأسئلة كلها تقرر إلى أي مدى يمكن فعليًا استخدام عرض النطاق.
بعض الشبكات عرض نطاقها على الورق مرتفع جدًا.
لكن عند التشغيل الحقيقي، بسبب عدم توازن توزيع المسار وبطء ردود فعل الازدحام وعدم سرعة معالجة نقاط نهاية الخادم، لا يمكن ضمان تشغيل كامل العنقود بثبات حتى يمتلئ بالكامل.
ومن ثم ظهرت تلك الصورة المبالغ فيها قليلًا:
المنافذ سريعة، والمعدات مكلفة، ومع ذلك ما زالت GPU تنتظر.
حتى شبكات الشركات التقليدية قد تتعرض للازدحام، لكن بطء طلب أعمال واحد عادة لا يجعل آلاف الخوادم تتوقف معًا.
في تدريب AI الموزع، تكون العقد أكثر تعاونًا. إنها كفريق يجب أن يتحرك خطوة بخطوة. تذبذب شبكي واحد قد يجعل مجموعة من الأجهزة تفقد الإيقاع في الوقت نفسه.
لذلك لا تحتاج شبكة AI إلى مجرد «أنابيب» أكثر سماكة.
كما يجب أن توفر ترتيبًا أفضل للمسارات، وتأخرًا أكثر ثباتًا، وردود فعل أسرع للانسداد (الازدحام)، وقنوات بيانات أقرب إلى GPU.
التدريب هو أكثر ما يخشاه أن يتأخر أحد
لدى التدريب واسع النطاق نظامٌ شديد الصرامة.
يتولى كثير من العقد جزءًا من العمل، وعند الخطوات الحاسمة يجب أن يجتمعوا. أنهت أغلب العقد الحساب الحالي بالفعل، لكن طالما بقيت قلة من العقد تنتظر البيانات، فستصبح المهمة كاملة صعبة جدًا في أن تدخل بسلاسة إلى الجولة التالية.
غالبًا ما تُسمى هذه العقد «عقد الذيل» (الـ拖尾节点).
وقد لا تكون بطيئة دائمًا.
قد يحدث الازدحام فقط في لحظة معينة؛ أو يحدث إعادة إرسال مرة واحدة؛ أو قد تكون المسارات أطول من غيرها بخطوات قليلة. في الأيام العادية لا تعني هذه الفروق الكثير؛ لكن إدخالها في التدريب المتزامن قد يضخمها عنقود كامل بحيث تصبح مؤثرة جدًا مرة واحدة في التأخير.
شخص يتأخر خمس دقائق، ما يتأخر إلا هو.
لا بد أن تنطلق مجموعة من الناس معًا؛ إذا تأخر أحدهم، سيضطر الجميع إلى الانتظار.
لهذا السبب يهتم التدريب الشبكي بثلاثة أمور أكثر من غيرها: هل الاتصالات سريعة بما يكفي، وهل التأخر ثابت أم متقلب، وهل يمكن لكثير من العقد أن تتقدم بإيقاع شبه متشابه نحو الأمام.
إن تكبير أرقام المنافذ وحدها يحل جزءًا فقط من المشكلات.
الطوبولوجيا مهمة كذلك.
الطوبولوجيا هي كيفية تنظيم الخوادم والمبدلات والروابط. وبغض النظر عن عدد الأجهزة المتشابه، فإن اختلاف طريقة التوصيل يغير مسافة الطريق التي يجب أن تسلكها البيانات، ومسارات الاختيار الممكنة، وقدرة الالتفاف بعد الأعطال.
كما أن منصة التبديل تتقدم إلى الواجهة هنا.
switch ASIC (شريحة التبديل) مسؤولة عن تمرير وتنظيم تدفق المرور بين عدد كبير من المنافذ. فهي تحدد سعة التبديل وكثافة المنافذ، وتؤثر كذلك في موازنة التحميل، واختيار المسارات، وإدارة الازدحام.
المنتج المتاح رسميًا دفع سعة شريحة تبديل واحدة إلى نطاق 102.4Tb/s، وحدد كذلك هدفه نحو عنقودات AI أكبر. ما توضحه مواد Broadcom حول Tomahawk 6 ليس أن العملاء قد أكملوا التحول الكامل، بل أن ضغط الشبكة انتقل بالفعل من منافذ الضوء إلى داخل منصة التبديل نفسها.
ولا يمكن أن يُستهان بالموقع من جهة الخادم.
NIC (بطاقة واجهة الشبكة) هي نقطة اتصال البيانات بين الخادم والشبكة. أي بيانات داخل GPU يجب أن تخرج، وأي بيانات في الشبكة يجب أن تدخل—تمر جميعها عبر نقاط النهاية.
غالبًا ما تتطلب عملية نقل البيانات التقليدية مشاركة المعالج، وقد يتم نسخ البيانات مرارًا بين مناطق ذاكرة مختلفة. ما تحاول RDMA (الوصول المباشر للذاكرة عن بُعد) فعله هو تقصير هذا الطريق، بحيث يمكن لخادم واحد الوصول بشكل أكثر مباشرة إلى ذاكرة خادم آخر، وتقليل الالتفاف البرمجي غير الضروري.
أما GPUDirect RDMA فيقصر هذا الطريق أكثر، بحيث يمكن لأجهزة الشبكة إنشاء مسار تبادل بيانات أكثر مباشرة مع ذاكرة GPU. ما يتم توفيره ليس مجرد خطوة تقنية واحدة؛ بل وقتٌ ومعالجةٌ مشغولة وانتظار GPU أيضًا. وثائق NVIDIA الرسمية للـ技术 تحدد كيفية عمل مسار البيانات هذا، وتذكر أيضًا قيود المنصة والنظام.
حين تنشغل الشبكة، يجب أن يوجد من يحافظ على النظام.
وهذا هو التحكم في الازدحام.
يرسل عدد كبير من العقد البيانات في الوقت نفسه، فتُسدّ بعض المسارات أولًا. إذا كانت استجابة النظام بطيئة، ستبدأ البيانات في التكدس والضياع وإعادة الإرسال، وسيزداد عدد العقد المتأخرة (الذي يؤثر على الذيل) أكثر فأكثر؛ وإذا كان النظام شديد الحذر بشكل زائد، فقد يترك عددًا كبيرًا من المسارات غير مستخدم خوفًا من الازدحام.
التحكم الجيد في الازدحام يجب أن يوازن بين طرفين:
لا يمكن سد الطريق بالكامل، ولا يمكن أيضًا منع السيارات من المرور خوفًا من الازدحام.
سلسلة مواصفات UEC 1.0 التي أصدرتها جمعية Ultra Ethernet Consortium (اتحاد الإيثرنت فائق السرعة) تضع ضمن نفس منظومة Ethernet الموجهة نحو AI والحوسبة عالية الأداء: النقل، والتحكم في الازدحام، والوصول المباشر للذاكرة (DMA-like)، وواجهات الشبكة، والمبدلات، والبصريات، والكابلات، وعمليات التشغيل والصيانة، والاختبار. تشير وثيقة الإصدار الرسمية الخاصة بـUEC بحد ذاتها إلى أن شبكة AI تجاوزت منذ زمن نطاق وحدة واحدة أو مبدل واحد.
لا داعي أيضًا لكتابة Ethernet و InfiniBand على أنها حرب يجب حسمها فورًا. ما يهتم به العميل في النهاية هو أثر العنقود: ضمن حجمه وأحماله ومكدس البرمجيات وهيكل صيانته، أي شبكة أكثر ثباتًا وكفاءة وأسهل في التوسع. يمكن أن تتعايش مسارات البروتوكول، ولن تتنازل نتائج الإنتاج بسبب الشعارات.
في النهاية، التدريب لا ينبغي أن ينظر فقط إلى «كم G تم تشغيلها».
المشكلة الأكثر واقعية هي:
في كل دورة تدريب، كم من الوقت يتم فعليًا في الحساب؟
كم من الوقت يُستهلك في المزامنة والانتظار؟
كم من الوقت يحتاج العمل الكامل لإكماله؟
بعد حدوث شذوذ في الشبكة، هل يمكن للمهام أن تستعيد الاستقرار بسلاسة؟
عندما ترتفع كفاءة الشبكة، يقصر وقت التدريب، وتتحسن الاستفادة من GPU.
عندما تنخفض كفاءة الشبكة، قد لا تقلل شيئًا من عدد الشرائح، لكن المخرجات تتسرب تدريجيًا.
الاستدلال هو الأكثر خوفًا من أن يصبح بطيئًا جدًا أحيانًا.
التدريب يشبه مشروعًا طويلًا.
الاستدلال أقرب إلى عمل تجاري تُفتح أبوابه كل يوم.
يسأل المستخدم، فتصدر الأنظمة في المؤسسة طلبًا، يستدعي الوكيل الأدوات، ويقوم النموذج بتوليد الإجابة. تصل الطلبات الواحدة تلو الأخرى بلا توقف، بأطوال مختلفة، وصعوبات مختلفة، وسياقات مرافقة مختلفة كذلك.
بعضها يكفي فيه جوابٌ قصير بجملة واحدة.
هناك من يسحب كامل وثيقة معًا.
بعض الأشخاص أيضًا يراجعون الوثائق ويضبطون الأدوات ويدخلون أنظمة خارجية.
التدريب الشبكي يخشاه أن يتخلف شخص ما عن الركب عندما يتحرك الجميع بخطوة واحدة.
شبكة الاستدلال تخاف أكثر من تقلبات المرور—ارتفاعًا وانخفاضًا—وتخاف كذلك من أن تتأخر نسبة قليلة من الطلبات تأخرًا مبالغًا فيه.
هنا يجب الحديث عن تأخر الذيل.
افترض أنه بين 100 طلب، أكثر من 90 تصل بسرعة، لكن بضعة طلبات تتأخر كثيرًا. إن نظرت إلى المتوسط فقط، يبدو أداء النظام جيدًا؛ لكن عند وصوله للمستخدمين، ربما يواجهون بالضبط تلك الطلبات القليلة البطيئة.
إن تأخّر الذيل هو بالضبط ما تصفه هذه الدفعة من أبطأ الطلبات.
أداة الدردشة لا تكتب الكلام لفترة طويلة، ومساعد البرمجة يتعثر في التوليد، ونظام خدمة العملاء يتوقف فجأة أمام العميل. حتى لو كان متوسط التأخر جيدًا، لا يمكنه أن يعزي الشخص الذي ينتظر فعليًا.
الاستدلال لديه أيضًا طبقة إضافية من مشكلات الجدولة.
عادةً يتم نشر نفس النموذج على العديد من الخوادم.
وصلت الطلبات، وعلى النظام أن يقرر: أي آلة ما زالت أيسر؟
أي آلة وضعت عليها عدد كبير جدًا من المهام؟ وأي آلة تحفظ سياقات يمكن إعادة استخدامها؟ وإلى أين نرسل الطلبات حتى نقلل حسابًا مرة أخرى ونؤخر أقل؟
إذا قُسمت الأمور جيدًا، يمكن لـ GPU أن تعمل باستمرار.
عندما تُقسَم بشكل غير جيد: جهة مشغولة لا تلتقط أنفاسها، وجهة أخرى ما تزال بلا عمل.
بوابة GKE Inference Gateway من Google Cloud وضعت قرارات التوجيه ضمن سياق قرارات تشمل قائمة انتظار الطلبات، واستعمال المسرّعات، ومعدلات نجاح KV cache (ذاكرة القيم الرئيسية). سيقوم النظام بإرسال الطلبات التي تشترك في سياق إلى نسخ نماذج أكثر احتمالًا أن تضرب الـcache، ويتجنب العقد التي فيها قوائم الانتظار طويلة جدًا أو الأحمال عالية جدًا. توضّح وثائق Google Cloud الرسمية أن دور شبكة الاستدلال انتقل من «إرسال الطلب» إلى «إرساله إلى المكان الأنسب».
يقوم KV cache بحفظ حالة السياق التي تتكون أثناء عملية استدلال النموذج.
كلما طال السياق، زادت جولات الحوار، وكبر حجم ذاكرة التخزين المؤقت. وبمجرد أن تُشارك ذاكرة التخزين المؤقت عبر العقد أو تُنقل أو يتم الوصول إليها عن بُعد، تدخل الشبكة بعمق أكبر في مسار الاستدلال.
أين توجد البيانات، وإلى أين تُرسَل الطلبات، ومن أي طريق تُقرأ ذاكرة التخزين المؤقت—كل ذلك يؤثر في سرعة الاستجابة والتكلفة لكل وحدة.
ستفك هذه الآلية لاحقًا على حدة.
فقط تذكر هنا: التدريب والاستدلال يحتاجان شبكة عالية الأداء، لكن التناقضات الرئيسية ليست هي نفسها تمامًا.
التدريب يهتم بالمزامنة واسعة النطاق وزمن اكتمال المهام.
الاستدلال يهتم بالإنتاجية المستمرة والتوجيه الديناميكي واستقرار الاستجابة.
يمكن تلخيص الأمر في جملة واحدة:
التدريب يخاف الانتظار، والاستدلال يخاف التذبذب.
هذا ليس فصلًا مطلقًا. التدريب كذلك يخاف التذبذب، والاستدلال يحتاج عرض نطاق كبيرًا.
لكنها تلتقط مشكلتين من أسهل المشكلات التي يفضحها نوعا الأحمال.
الوحدة الضوئية على الباب، وداخل الباب توجد منظومة كاملة من النظام.
الوحدة الضوئية لا تزال مهمة، وستبقى مهمة لفترة طويلة نسبيًا.
الإشارة الكهربائية لا تصلح لنقل فعّال عبر كل المسافات وكل السرعات. وبمجرد أن يعبر خادم GPU عبر خزانة أو غرفة خوادم أخرى، تصبح الوصلة الضوئية السريعة خيارًا واقعيًا لنقل البيانات.
وحدات الضوء القابلة للاستبدال موجودة بالفعل بشكل ناضج؛ فعمليتا التركيب والاستبدال أوضح نسبيًا، وسلسلة التوريد أكثر اكتمالًا. وعندما تتجه سرعات المنافذ للأعلى، غالبًا ما تكون هي أول من يستقبل هذا الطلب.
لا مشكلة في اعتبار وحدة الضوء القابلة للاستبدال/التركيب كأوضح طبقة تسليم لشبكة AI الحالية.
المشكلة في اعتبار طبقة التسليم هي القيمة الكاملة.
قد تُسرّع وحدة ضوئية واحدة انتقال بيانات عبر مسار، لكنها ليست مسؤولة عن كيفية تنظيم المرور داخل كامل العنقود. فهي لا تحل جميع قوائم الانتظار، ولا تراقب مزامنة العقد، ولا يمكنها وحدها معالجة تحديد موقع الأعطال وجدولة التشغيل.
الشبكة الكاملة لـ AI هي سلسلة طويلة تمتد من GPU حتى غرفة الخوادم الفيزيائية.
الجهة الأقرب إلى الحساب تشمل GPU وذاكرة الخادم وواجهات الشبكة. يجب أن تمر البيانات بأقل التفافات وأقل نسخ وأقل احتلال للمعالجات قدر الإمكان.
في منتصف الشبكة توجد شرائح التبديل وأجهزة التبديل. فهي تنظم المسارات، وتوزع المرور، وتفصل المهام، وتتعامل مع الازدحام تحت الأحمال العالية.
إلى الخارج أكثر، توجد وحدات الضوء والألياف والكابلات والوصلات. تجعل هذه الإشارة تنتقل بثبات عبر غرف الخوادم الحقيقية.
تحتها أيضًا بروتوكولات وإدارة و observability (قابلية الملاحظة). يجب أن يعرف النظام أين يحدث الاختناق، وأي وصلة غير مستقرة، وأي مهمة تُبطئ الآخرين، وكيفية التعامل معها.
تنظيم NVIDIA لمجموعة Spectrum-X يضع أجهزة التبديل وSuperNIC (بطاقات واجهة شبكة فائقة) وRoCE والتحكم في الازدحام وtelemetry (المراقبة/الاستشعار عن بُعد) من طرف إلى طرف وضبط البرمجيات كلها داخل منصة Ethernet واحدة موجهة لـ AI. يجب النظر إلى معامل الأداء الذي يقدمه المصنعون مع شروط الاختبار، لكن هذه المعمارية بحد ذاتها توضح تغير احتياجات العملاء: العملاء يريدون حل كفاءة العنقود، ولا أحد يريد شراء مجموعة من القطع غير المتصلة ببعضها. كما أن وصف المنتجات الرسمية لـ Spectrum-X يضع ضبط المستوى الكامل والتحكم في الازدحام وقابلية الملاحظة في سرد واحد.
هذا سيغير طريقة مراقبة القيمة في الصناعة.
في الماضي، كانت لغة الحديث عن الاتصالات الضوئية هي المعدل، والشحنات، والسعر للوحدة، والترقية بين الأجيال.
بعد دخول مصنع AI، يجب طرح عدة أسئلة إضافية:
هل يمكن لمنصة التبديل دعم عنقود GPU أكبر؟
هل تقللت نقاط نهاية الشبكة من التفاف البيانات؟
هل يمكن للبروتوكولات أن تتعامل مع تدفق متزامن متفجر؟
هل يمكن لفريق التشغيل والصيانة أن يجد بسرعة رابط الشبكة الذي يبطئ التدريب؟
استهلاك الطاقة والحرارة في شبكة عالية السرعة نفسها—هل يمكن للخزانة أن تتحملها؟
لا تزال أجيال المنتج مهمة، لكن العملاء بدأوا يضعون كفاءة العنقود فوق ذلك.
شريحة تبديل واحدة لم تعد مجرد تجميع لعدد كبير من المنافذ. إنها تؤثر في كيفية توزيع المرور في كامل الشبكة.
بطاقة واجهة شبكة واحدة ليست مجرد ملحق للخادم. إنها تؤثر في كيفية دخول وخروج بيانات GPU.
مجموعة بروتوكول تبدو كأنها مختبئة في الخلفية، لكنها في الواقع تحدد ما إذا كانت الفوضى ستحدث في الأوقات المزدحمة.
كما أن الاختبار وقابلية الملاحظة ليست مجرد إضافات ما بعد البيع. فكلما كبر حجم العنقود، زادت سرعة العثور على المشكلة واقترب ذلك من القدرة الإنتاجية نفسها.
بعض العتبات ليست لامعة، لكنها حقًا تُعيق الناس.
في الشبكات عالية السرعة، الأكثر وضوحًا دائمًا هو الشرائح والوحدات.
ما يدفع المنتج من المعرض إلى عشرات الآلاف من الأجهزة غالبًا ليس ما يظهر على الشاشة كثيرًا.
يجب أن تتحمل الوصلات كثرة مرات الإقلاع والتركيب، وأن تبقى مستقرة أيضًا في بيئة ذات كثافة عالية وحرارة طويلة الأمد. كلما زادت الألياف، ستزداد تعقيدات التمديد، ونصف قطر الانحناء، والترقيم، ومساحة الصيانة.
كلما ارتفعت السرعة، قلّت محالاة الأخطاء الصغيرة وعدم التساهل معها.
فقدان بسيط في الإشارة، وتغير بسيط في الحرارة، وانحراف بسيط في التصنيع—على سلاسل السرعة العالية قد تُضخَّم كل هذه الأمور.
والاختبار سيصبح أكثر صعوبة كذلك.
إن تشغيل مسارٍ واحد في المختبر لا يثبت سوى أنه يمكن استخدامه تحت ظروف مُتحكم بها.
عند دخول المصنع، يجب التحقق من اتساق تصنيع الدفعات.
بعد الدخول إلى غرفة الخوادم، يجب أيضًا التحقق من إمكانية عمل الوحدات وأجهزة التبديل والتمديدات والبروتوكولات وعبء العمل الحقيقي معًا.
إطلاق منتج شيء،
تأمين تشغيل آلاف الوصلات عالية السرعة بثبات لسنوات وسنوات شيء آخر تمامًا.
وفي الخلف توجد اختبارات التصنيع والتحقق من النظام وتشخيص الموقع وإجراءات الصيانة.
لهذا السبب لم تعد قابلية الملاحظة مجرد لوحة عرض جميلة.
قد لا تظهر الحالات الشاذة في عنقود AI الكبير يوميًا. في العادة يبدو كل شيء طبيعيًا؛ لكن ما إن تبدأ مهمة التدريب حتى تتكدّس مسارٌ ما فجأة؛ أو قد يصبح منفذٌ ما أبطأ فقط تحت تركيبة محددة من الأحمال المرورية.
إذا كان النظام يعرف فقط أن «المهمة تعمل ببطء»، لكنه لا يستطيع رؤية مكان البطء، فبعد يوم من البحث، قد تستمر GPU في الانتظار يومًا آخر.
تستخدم مواد Google المنشورة عن Telemetry عالي الدقة لتحديد microbursts الشبكية التقليدية منخفضة التواتر التي قد لا يراها المراقبة المعتادة. كما تُدرج مواصفة UEC التشغيل والصيانة والاختبار ضمن منظومة اتصالات كاملة. كلما كبر حجم الشبكة، أصبح الفصل بين «رؤية واضحة» و«نقل سريع» أكثر صعوبة.
لكن لا ينبغي أن يبدأ حكم الصناعة بالتهيج من هنا.
الاختبار مهم، لكن لا يعني أن كل مراحل الاختبار تحقق أرباحًا مرتفعة.
لا غنى عن الوصلات، لكن زيادة العدد لا تمنح تلقائيًا نفوذ التسعير.
أهمية إحدى القدرات لا تعني إلا أنها دخلت المسار الحرج.
لتحويل الأهمية إلى قيمة صناعية، لا بد أن ننظر أيضًا إلى اعتماد العملاء، والعوائق التقنية، والمنافسة بين الموردين، وصعوبة الاستبدال، وإلى من تتحمل المسؤولية عندما تحدث مشكلة.
المهم هو أنه نقطة البداية.
الندرة وقابلية التسليم وصعوبة الاستبدال—هذه هي الأمور اللاحقة.
ما يشتريه العميل ليس أبدًا أرقام المنافذ
من وجهة نظر العميل، غاية شراء الشبكة بسيطة جدًا في جوهرها.
أن ينتهي التدريب مبكرًا.
قلل انتظار GPU قليلًا.
توليد المزيد من الطلبات للمعالجة في الاستدلال.
لا تدع أبطأ دفعة من الطلبات تتأخر تأخرًا فاضحًا.
حين تتعطل المنظومة، يستطيع المهندسون العثور على السبب بأسرع وقت ممكن.
لذلك، تنتهي شبكات AI بأربعة نتائج في النهاية: استغلال GPU، انتظار التدريب، إنتاجية الاستدلال، وتأخر الذيل.
معدل المنفذ هو معامل المنتج.
زمن إتمام العمل واستقرار الخدمة—هذه هي نتائج العميل.
إذا دفع تحديث الشبكة أرقام المنافذ إلى الأعلى، لكنه جعل الاختبار أعقد، وإصلاح الأعطال أبطأ، وزادت بوضوح ضغوط استهلاك الطاقة والتبريد، فلن ينظر العميل فقط إلى أرقام المؤتمر الصحفي.
وبالمقابل، قد تبقى تقنية ما على قيد الحياة لفترة طويلة، حتى لو لم تكن جديدة بما يكفي، طالما كان توريدها ثابتًا، وصيانتها سهلة، ويمكن إدخالها بسرعة إلى غرفة الخوادم الحالية.
لا توجد في أرض الواقع الصناعية خريطة طريق مرسومة على نحوٍ مثالي.
ستتعايش الحلول الجديدة والقديمة.
اختلاف الأحجام والأحمال وشروط غرف الخوادم يجعل العملاء يتخذون اختيارات مختلفة. ربما تكون عنقودات التدريب الضخمة أكثر استعدادًا لتجربة معماريات متقدمة، بينما تميل الأنظمة متوسطة الحجم إلى الحلول الناضجة. كما تتطلب عنقودات الاستدلال اختيارات إضافية بناءً على شكل الطلبات وطول السياق وتوزيع الـcache.
والقيمة لن توزع بالضرورة بالتساوي.
زيادة الطلب على الوحدات الضوئية تثبت أن احتياج الوصلات السريعة حقيقي، لكنها لا تضمن أن كل مورد سيحصل على نفس الهامش من الأرباح.
عندما تدخل منصة التبديل في المسار الحرج، ترتفع أوزان شريحة التبديل في الصناعة، وقد يؤدي حجم شراء العملاء الكبير إلى الضغط على الأسعار أيضًا.
تزداد أهمية البروتوكولات والبرمجيات. قد تُستأدى قيمةٌ جزئية كاملة بواسطة المنصة المتكاملة، وقد لا تبقى للمورد المستقل.
تُصبح الوصلات والاختبار وعمليات التشغيل والصيانة في الواجهة، وقد تأتي منافسة جديدة بعد عملية التوحيد القياسي.
يمكن أن توضح النفقات الرأسمالية توسع الصناعة.
يمكن أن يوضح حجم السوق أن الطلب ليس صغيرًا.
لا يمكن لهاتين المسألتين أن تستبدلا الربح مباشرة.
من الطلب إلى الربح، يوجد بينهما توسع في العرض، وانتقال السعر، ومفاوضات العميل على الأسعار، والاعتماد، والتسليم.
أكثر خطأ شائع هنا هو تحويل عبارة «الشبكة أصبحت أكثر أهمية» إلى تلقائية «كل جزء داخل الشبكة سيكسب معًا».
لا توجد صناعة توفر كل هذا عناءً.
والحكم الأكثر أمانًا هو:
عندما تبدأ الشبكة بتقييد القدرة الحاسوبية الفعلية، وحين تصبح المراحل القادرة حقًا على تقليص وقت التدريب والاستدلال المستقر وتحمل مسؤولية تسليم النظام—عندها تميل أوزان الصناعة إلى الارتفاع.
قد تقع في اتصال بصري سريع، أو قد تقع في منصة التبديل، ونقاط نهاية الشبكة، والتحكم في الازدحام، والاختبار، وإدارة التشغيل.
أين تقع النتيجة بالضبط في النهاية؟ يعتمد الأمر على النشر الحقيقي، لا على من يطلق مصطلحًا أحدث أولًا.
حتى أقوى مسار رئيسي يحتاج أن يتحمل إثبات العكس
دخول شبكات AI إلى طبقة كفاءة الإنتاج هو تغييرٌ بنيوي.
هذا لا يعني أن احتياج العتاد سيصعد من الآن فصاعدًا على خط مستقيم.
البرمجيات ستستوعب جزءًا من الضغط.
يمكن لأساليب أفضل لتوازي النماذج أن تقلل الاتصالات غير الضرورية؛ ويمكن لجدولة المهام الأفضل أن تجعل الحساب والاتصال متداخلين (يعملان معًا). كما أن توزيع المرور الأكثر ذكاءً قد يسمح للشبكة القديمة أن تعمل أكثر.
حتى لو تم تعديل تصميم الطوبولوجيا جيدًا، فقد يستخدم العميل نفس العتاد لإكمال المزيد من المهام.
سيتغير النموذج نفسه أيضًا.
إذا تحسنت كفاءة النموذج، ونقص مقدار الحساب المطلوب لإكمال مهام من نفس النوع، فقد يتباطأ نمو الطلب الإضافي على حجم العنقود وموارد الاتصال. وقد تُعهد بعض مهام الاستدلال أيضًا إلى نماذج أصغر وأعظم تخصصًا، بدل وضع كل شيء في عنقود ضخم بشكل مطلق.
إيقاع النفقات الرأسمالية (CapEx) سيغير كذلك سرعة ترقيات الشبكة.
إن تأخر مشروع كبير، أو تباطؤ توسع عنقود التدريب، أو تحول مركز ثقل العميل من تدريب مركز إلى استدلال أكثر تشتتًا—كل ذلك يغير مجموعة احتياجات الوحدات الضوئية وأجهزة التبديل ونقاط النهاية.
توسع العرض سيغير الربح.
عند ندرة المنتجات عالية السرعة، يكون لدى الموردين فرصة أكبر لامتلاك نفوذ التسعير؛ لكن حين تدخل طاقة إنتاجية جديدة بسرعة، يُدخل العميل في الوقت نفسه عدة موردين، وقد تنعكس أسعار المنتج وهوامش الربح قبل أن تتغير الحاجة الفعلية.
الخطط الناضجة لها وزنها الخاص.
الوحدات الضوئية القابلة للاستبدال لها طرق صيانة واضحة وسلسلة توريد ناضجة وعادات طويلة لدى العملاء. حتى لو كانت معماريات الاندماج الكهروضوئي الأعمق لها مزايا نظرية، فإن العملاء قد يواصلون اختيار الحلول الناضجة طالما لم تُحل في الموثوقية وأساليب الإصلاح ومعدلات العائد وتقسيم المسؤوليات.
وإصدار المواصفة لا يعني تلقائيًا أنها ستصبح طلبًا.
إن إصدار مواصفة UEC يوضح أن Ethernet المفتوحة تستجيب بشكل منهجي لاحتياجات شبكات AI؛ وهو لا يعني أن كل العملاء قد أكملوا النشر وفقًا لنفس المواصفة.
عندما تقفز سعة شريحة التبديل إلى مستوى جديد، فهذا يثبت أن القدرة التقنية وصلت إلى تلك المرحلة؛ لكنه لا يعني أن كل مراكز البيانات قد استبدلت المعدات بالكامل.
يظهر نظام بصريات جديد في العلن ليشير إلى أن المسار يستحق البحث؛ لكن الوصول إلى تسليم واسع النطاق وقابل للصيانة ومربح قد يظل محاطًا بمسافة طويلة من العمل الهندسي.
خريطة الطريق هي فقط لتشير بالاتجاه.
فقط نظام الإنتاج هو من يتحمل مسؤولية حساب الأرباح.
لذلك، يمكن أن تكون الخطوط الرئيسية لشبكة AI قوية جدًا، لكن المسار التفصيلي لا يزال يحتاج إلى مساحة للتأقلم.
ستستمر مكانة الشبكة في مصنع AI في الارتفاع.
إلى أين تنتقل حصة الأرباح، ومدى سرعة الانتقال، وأخيرًا من ستكون في يده—لا توجد يقينية بنفس الدرجة.
عندما يبدأ الضوء بالاقتراب من الشريحة
نعود إلى غرفة الخوادم: صفوف من الأجهزة اللامعة التي تعمل.
وصلت وحدات GPU، ومعها فُتح الطريق بالكهرباء. لكن كم يمكن أن تنتج—لا يزال يعتمد على مقدار الوقت الذي يُنفق في الحساب الحقيقي، ومقدار الوقت الذي يُهدر في الانتظار.
الوحدة الضوئية تجعل البيانات تنتقل بسرعة كبيرة عبر مسار شبكي.
شريحة التبديل تحدد كيفية سير المرور.
نقاط نهاية الشبكة تقصر مسافة إدخال/إخراج البيانات إلى الخادم.
تقوم البروتوكولات والتحكم في الازدحام بالحفاظ على النظام في الأوقات المزدحمة.
يضمن الاختبار وقابلية الملاحظة أن هذه المنظومة يمكن تصنيعها ويمكن نشرها، وأنه حين يحدث خلل يمكن كشفه.
ومجرد اتحادها معًا هو ما يشكل الإنتاج الحقيقي لعنقود GPU.
هذا هو معنى أن شبكة AI انتقلت من قناة نقل إلى طبقة كفاءة الإنتاج.
ومع استمرار ارتفاع معدل المنافذ وسعة التبديل وكثافة الخزائن، ستظهر مشكلة أخرى أكثر صعوبة:
كلما سارت الإشارة الكهربائية أسرع بين شريحة التبديل ووحدة الضوء، صارت معالجة المسافة واستهلاك الطاقة والمساحة والتبريد أكثر صعوبة.
عندما تصل إلى تلك الخطوة، فإن جعل الوحدات القابلة للاستبدال أسرع فحسب قد لا يكون كافيًا بعد.
ستُدفع القدرات البصرية إلى أماكن أقرب إلى شريحة التبديل، وستتغير هيئة أجهزة التبديل تبعًا لذلك. إن CPO (البصريات المجمعة في حزمة واحدة) و silicon photonics (البصريات السيليكونية) وصلا إلى الصدارة تحت ضغط هذه القوة.
ما يجب فعلاً الإجابة عنه بعيدٌ جدًا عن مجرد: «كيف تبدو وحدة الضوء الجيل التالي».
المشكلة الأعمق تتمثل في:
طالما دخلت الشبكة إلى عالم الحساب، فكيف يجب أن يعود الضوء والشرائح ليقفوا معًا من جديد؟
لا يناقش هذا المقال سوى اتجاهات صناعة التكنولوجيا وآليات سلسلة الإمداد، ولا يشكل نصيحة استثمارية أو توصية بالورقة المالية أو استنتاجًا بخصوص إجراء خارجي.
