لماذا في عصر الذكاء الاصطناعي يُقال دائمًا إن الذاكرة غير كافية؟ في الحقيقة، الأمر مُقدَّر منذ أن يولَد الإنسان. بسبب اختناق فون نَويمان!

إن أساس الحواسيب الحديثة يقوم على معمارية فون نَويمان. تتمثل إحدى النقاط الأساسية في أن البرنامج والبيانات موجودان معًا في نفس وحدة التخزين. يقوم المعالج (CPU) بجلب التعليمات واحدًا تلو الآخر لتنفيذها.

مع تسارع قوة المعالجة في وحدات المعالجة المركزية/وحدات معالجة الرسوميات الحالية، أصبحت عملية نقل البيانات لا تلحق بسرعة تفكير الدماغ. كثيرًا ما يكون الدماغ في حالة انتظار البيانات. ويظهر هذا بشكل متزايد في عصر الذكاء الاصطناعي؛ إذ إن قنوات نقل البيانات بين القدرة الحاسوبية والذاكرة ليست بالسرعة الكافية، فتؤدي عملية نقل البيانات إلى إبطاء الحساب. وهذا هو اختناق فون نَويمان

هذا يشبه CPU/GPU كطاهٍ. والذاكرة مثل مستودع. والناقل/الترابط مثل ممرات توصيل الطعام. هناك عدد أكبر من الطهاة وإتقان أسرع في التقطيع، لكن المستودع بعيد عن المطبخ وممرات التوصيل ضيقة. النتيجة ليست أن الطهاة لا يعرفون الطبخ، بل أنهم ينتظرون المكونات。

في خوادم الذكاء الاصطناعي اليوم، يتم حصر عنق الزجاجة هذا أساسًا في أربع نقاط:

1: تأخر الذاكرة، كم من الوقت تحتاج لجلب قطعة بيانات واحدة؟

2: عرض نطاق الذاكرة، وكمية البيانات التي يمكن نقلها في وحدة زمنية。

3:هل يمكن للذاكرة استيعاب البيانات؟ إذا لم تستطع الاستيعاب، سيتعين اللجوء إلى SSD/قرص تخزين أبطأ。

4:استهلاك الطاقة ونقل البيانات نفسها يستهلكان كهرباء كبيرة. في كثير من الأحيان، نقل قطعة من البيانات أغلى من إجراء الحساب نفسه. يجب على نماذج اللغات الكبيرة أن تقرأ باستمرار: أوزان النموذج وذاكرة KV cache وقيم/قيمات التفعيل (activations) الداخلة والمخرجة لكل رمز token. إذا لم تكن سعة عرض نطاق HBM كافية، فحتى لو كانت قدرة GPU الحسابية قوية فلن تستطيع الاستفادة الكاملة منها。

فكيف نحل عنق الزجاجة لدى فون·نوييمان؟

لأنه لا يمكن إزالته بالكامل، بل يمكن فقط التخفيف منه。

1. أضف ذاكرة وسيطة (Cache) للـ CPU/GPU، فلا يصلان إلى الذاكرة مباشرة في كل مرة، بل يستخدمان عدة مستويات من الكاش

2. زيادة عرض نطاق الذاكرة: الآن أكثر ما ينقص هو HBM. الفكرة هي: تجميع الذاكرة في حزمة، ووضعها بجانب الـ GPU، مع استخدام واجهة فائقة الاتساع للربط。

3. ضع الحساب والذاكرة بالقرب من بعض، مثل: GPU + HBM، CPU + HBM، تكديس ثلاثي الأبعاد، تغليف متقدم chiplet، وتوسيع ذاكرة CXL. جوهر الفكرة هو تقليل مسافة نقل البيانات。

4. تقليل كمية البيانات: في الذكاء الاصطناعي تُستخدم تقنيات مثل التكميم Quantization FP8 / INT8 / FP4، والترقيم/التخفيف Sparse، وقلع/حذف أجزاء من النموذج (model pruning)، وضغط KV cache، وGQA / MQA / MLA، وFlashAttention. الفكرة ليست جعل القنوات أعرض، بل جعل البيانات التي يجب نقلها أقل.

5. تعديل الخوارزميات والبرمجيات، مثل: الاستباق (data prefetch)، المعالجة الدفعية (batch processing)، دمج العمليات (operator fusion)، وتغيير تخطيط البيانات لزيادة معدل إصابة الكاش، وتقليل القراءات/الكتابات المتكررة. كثير من الزيادات في الأداء ليست لأن العتاد أصبح أقوى، بل لأن البرمجيات تجعل نقل البيانات يتم مرات أقل。

6. الترابط الضوئي / CPO: عندما يصبح نقل البيانات بين الشرائح وبين رفوف الخوادم هو عنق الزجاجة، نستخدم الضوء。

بعد أن قرأت كل ما سبق، هل أدركت أخيرًا أن عنق الزجاجة لدى فون·نوييمان ليس مجرد عيب في تصميم واحد، بل هو التناقض الجوهري في الحوسبة الحديثة: أصبح الحساب أرخص فأرخص، بينما أصبح نقل البيانات أغلى فأغلى。

في السابق كان الجميع يتنافس أساسًا على تردد وحدة CPU. الآن يتنافس الجميع على: كاش HBM، التغليف (封装)، عرض نطاق الذاكرة، شبكة مراكز البيانات، الترابط الضوئي، والحوسبة داخل الذاكرة (存内计算)، وجدولة البرامج. لذلك في عصر الذكاء الاصطناعي، أصبحت HBM وDRAM وSSD وCPO والوحدات الضوئية OCS أكثر أهمية؛ جوهر الأمر هو معالجة هذا عنق الزجاجة。#美股科技股反弹道指创新高