أولًا، المرحلة الأولى: جعل الآلات «ترى» — عصر القواعد → عصر الإدراك


في الحقيقة، بدأت قصة الذكاء الاصطناعي منذ وقتٍ طويل.


يُنظر عادةً إلى مؤتمر دارتموث عام 1956 باعتباره نقطة البداية المهمة لظهور الذكاء الاصطناعي الحديث كمجال بحثي مستقل. في ذلك الوقت، كان الذكاء الاصطناعي يعتمد أكثر على وضع الإنسان للقواعد يدويًا، مع الأمل في كتابة منطق البشر مباشرةً في الآلة.


المشكلة الجوهرية في هذا العصر هي:


«هل يمكنني أن أخبر الآلة بما يجب أن تفعله؟»


مثلًا:



  • إذا كان A، إذن B؛


  • إذا رأى سمةً ما، فسيُحكم أنها جسمٌ ما؛


  • إذا تحققت بعض الشروط، فسيتم تنفيذ إجراءٍ ما.


كما أن المشكلة واضحة جدًا:


العالم الحقيقي معقد جدًا.


يمكن للإنسان أن يحكم بسهولة:


“هذه قطة.”


لكن يصعب جدًا أن تكتب “ما هو القط” على شكل مئات الآلاف من القواعد.


وهكذا بدأ الذكاء الاصطناعي ينتقل من:


جعل الآلة تنفذ القواعد التي كتبها الإنسان


التحول إلى:


لجعل الآلة تتعلم الأنماط بنفسها من البيانات.


وهذا هو السبب الجذري لظهور التعلم الآلي ثم التعلم العميق لاحقًا.



الثاني، 2012: الذكاء الاصطناعي “يفهم العالم” لأول مرة فعلًا


كان ImageNet في عام 2012 نقطة تحول شديدة الأهمية.


استخدم AlexNet شبكة عصبية التفافية عميقة وحقق اختراقًا في مهمة التعرف على الصور واسعة النطاق، مما جعل الصناعة كلها تعيد إدراك أن:


أنت تعطيه جملة، فيتنبأ بالجملة التالية.


وبعد هذا دخل الذكاء الاصطناعي عصر التعلم العميق.


ولهذا ظهرت مجموعة كبيرة من القدرات التي اعتدنا عليها اليوم:



  • تصنيف الصور


  • التعرّف على الوجوه


  • OCR


  • الرؤية في القيادة الذاتية


  • التعرّف على الصور الطبية


  • فهم الفيديو


  • أنظمة التوصية


أكثر ما يبرع فيه الذكاء الاصطناعي في هذه المرحلة هو:


التعرّف.


أعطه صورة، فيخبرك:


“هذا قط.”


تعطيه مقطعًا صوتيًا، فيخبرك:


“هذا ما قلته.”


إذا أعطيته صورة أشعة، فإنه يحكم على:


“يوجد هنا شذوذ.”


لكنه لم يكن قد فهم هذا العالم حقًا بعد.


إنه فقط صار أفضل في استخراج الأنماط من المدخلات.



الثالث، 2016: AlphaGo أخبر العالم أن الذكاء الاصطناعي لا يستطيع التعرّف فقط، بل يمكنه أيضًا “التفكير”


في عام 2016، كان انتصار AlphaGo على لي سيدول نقطة مفصلية أخرى ضخمة في تاريخ الذكاء الاصطناعي.


لم يكن AlphaGo مجرد حفظ سجلات اللعب.


إنه يحول:


الشبكات العصبية العميقة + البحث + التعلم المعزز


دمجها معًا.


لقد تعلّم من سجلات البشر في الشطرنج، ثم واصل التعلم عبر اللعب مع نفسه. وفي النهاية كوّن، داخل فضاء البحث الهائل في لعبة Go، استراتيجية تجاوزت أفضل لاعبي العالم.


تكمن أهمية هذا الأمر في:


أظهر الذكاء الاصطناعي لأول مرة وعلى نطاق واسع:


لا تستطيع الآلة فقط التعرّف على الأنماط، بل يمكنها أيضًا تشكيل استراتيجية عبر التدريب والبحث والتغذية الراجعة والتجربة والخطأ.


وهكذا بدأت قدرات الذكاء الاصطناعي تنتقل من:


Perception الإدراك


إلى:


القرار Decision


تطور.


وقد زرع هذا البذور لاحقًا للتعلم المعزز، ونماذج الاستدلال، وAI Agent.



الرابع، 2017: Transformer غيّر صناعة الذكاء الاصطناعي بأكملها


إذا كان عام 2012 هو انفجار عصر التعلم العميق، فإن 2017 كان بالفعل الأساس التقني الحقيقي لعصر النماذج الكبيرة اليوم.


في هذا العام، نشر فريق Google ورقة بحثية:


(Attention Is All You Need)


طرح Transformer.


أكبر تغيير فيه أنه وضع “Attention” في قلب النموذج، كما أنه مناسب جدًا للتدريب المتوازي واسع النطاق.


لاحقًا بُني تقريبًا عالم الذكاء الاصطناعي التوليدي كله على هذا المسار التقني:


Transformer → GPT → LLM → نموذج متعدد الوسائط → Agent → نموذج العالم


لذلك فإن ما نراه اليوم من ChatGPT وClaude وGemini لم يظهر فجأة.


إنها في الواقع تمثل العقود الماضية من:


البيانات + الشبكات العصبية + GPU + Transformer + Scaling


نتيجة التراكم المشترك.



الخامس، 2020: أثبت GPT-3 شيئًا مهمًا جدًا


في عام 2020، أطلقت OpenAI نموذج GPT-3.


175 مليار معلمة.


أهميته ليست فقط لأنه “كبير”.


الأمر المهم حقًا هو:


بعد تضخم حجم النماذج، ظهرت قدرات عامة أقوى وأقوى من نوع “الانبثاق”.


أصبح GPT-3 قادرًا على إنجاز مهام مختلفة عبر عدد قليل من الأمثلة، دون الحاجة إلى إعادة تدريب النموذج لكل مهمة على حدة.


وهذا غيّر المسار البحثي لصناعة الذكاء الاصطناعي.


كان الناس يفكرون سابقًا أن:


تدريب نموذج واحد لمهمة واحدة.


ثم تحولت تدريجيًا إلى:


تدريب نموذج أساسي ضخم بما يكفي، ثم جعله يتكيف مع عدد كبير من المهام.


وهنا ظهر مفهوم مهم جدًا:


Foundation Model


النماذج الأساسية.


وهذا أيضًا هو جوهر انفجار الذكاء الاصطناعي في السنوات الماضية.



السادس، 2021—2022: بدأ الذكاء الاصطناعي ينتقل من “فهم النص” إلى “توليد العالم”


هذه المرحلة مهمة جدًا، لأن الذكاء الاصطناعي بدأ يتجاوز النص البحت.


كان DALL·E من OpenAI قادرًا بالفعل على توليد الصور من النص.


ثم:



  • Stable Diffusion


  • Midjourney


  • DALL·E


  • Imagen


  • Sora


  • Veo


الاستمرار في نقل قدرة الذكاء الاصطناعي على التوليد من:


نص → صورة → فيديو → صوت → 3D


التوسع إلى الخارج.


وهكذا بدأ الذكاء الاصطناعي يظهر تغيرًا واضحًا جدًا:


في السابق كان الأمر:


الذكاء الاصطناعي يفهم المحتوى الذي يبدعه البشر.


الآن أصبح:


الذكاء الاصطناعي يبتكر المحتوى بنفسه.


هذا هو Generative AI.



السابع، نهاية 2022: ChatGPT أدخل الذكاء الاصطناعي إلى عصر الجماهير


بعد 2022، دخل الذكاء الاصطناعي بالفعل حياة الناس العاديين.


أكبر اختراق لـ ChatGPT لم يكن أول ظهور لنموذج لغوي.


بل تحويل عدد كبير من القدرات المعقدة للذكاء الاصطناعي إلى:


واجهة يمكن لشخص عادي التحدث معها مباشرة.


من هذه اللحظة:


أصبح الذكاء الاصطناعي أول مرة أداة إنتاجية جماهيرية فعلًا.


كتابة المقالات، كتابة الكود، الترجمة، التلخيص، التحليل، البحث، التعلم……


كل شيء بدأ يدور حول:


“أنت تخبر الذكاء الاصطناعي بما تريد فعله.”


توسيع.


ولذلك، تنافست صناعة الذكاء الاصطناعي خلال السنوات الماضية تقريبًا حول سؤال واحد:


من يملك نموذجًا أكبر وأقوى؟



الثامن، 2023—2025: بدأ الذكاء الاصطناعي يتطور من “الدردشة” إلى “الاستدلال”


وهذه في الحقيقة هي الخطوة الأهم الآن لفهم الذكاء الاصطناعي.


كانت النماذج الكبيرة المبكرة أشبه بـ:


متنبئ لغوي فائق.


مسار بحث Meta جدير جدًا بالاهتمام.


لكن لاحقًا بدأ البحث يولي اهتمامًا أكبر لـ:



  • Chain of Thought


  • Reinforcement Learning


  • Test-time Compute


  • Reasoning


  • Tool Use


  • Planning


  • Long-horizon tasks


أي:


لم يعد الذكاء الاصطناعي يكتفي بـ:


“أعطيك جوابًا.”


وبدأت تحاول:


“دعني أفكر قليلًا أولًا، ثم أنجز هذه المهمة.”


وهذا هو Reasoning Model.


بحلول 2026، أصبحت بوضوح نقطة التركيز في المنافسة بين OpenAI وAnthropic وGoogle وغيرها من المختبرات الرائدة تنتقل من مجرد قدرات الدردشة إلى:


استدلال معقد + برمجة + استدعاء أدوات + مهام طويلة + Agent.


على سبيل المثال، يؤكد GPT-6 Astra الأحدث من OpenAI على قدرات مثل الرياضيات، وهندسة البرمجيات، وتشغيل الحاسوب، وتشغيل المتصفح، والعمل المهني؛ كما تواصل OpenAI تحسين النماذج والبنية التحتية للاستدلال وAgentic Harness.


كما أن سلسلة Claude 5.5 الأحدث من Anthropic تؤكد بوضوح على الأعمال المعقدة، والمهام طويلة الدورة، وAgentic Coding.


وهذا يعني:


لقد انتقل الذكاء الاصطناعي من “الإجابة عن الأسئلة” إلى “إتمام المهام”.


هذه نقطة فاصلة مهمة جدًا اليوم.



التاسع، إذن إلى أين وصل الذكاء الاصطناعي السائد الآن؟


إذا رسمنا صناعة الذكاء الاصطناعي في 2026 على شكل خريطة، فيمكن تقسيمها تقريبًا إلى المسارات التالية.


































































مسار الذكاء الاصطناعي


القدرة الأساسية الحالية


يمثل اللاعبين


الخطوة التالية


LLM


اللغة، المعرفة، الاستدلال


OpenAI وAnthropic وGoogle


استدلال أقوى، Agent


Multimodal


نص + صورة + صوت + فيديو


OpenAI وGoogle وMeta وMistral


تمثيل موحّد للعالم


AI Agent


تنفيذ المهام تلقائيًا


OpenAI وAnthropic وGoogle


العمل الذاتي طويل الدورة


Coding Agent


كتابة الكود، تعديل الكود، النشر


OpenAI وAnthropic وGoogle وغيرها


أتمتة هندسة البرمجيات


Video World


توليد الفيديو، الفهم


Google وOpenAI وغيرها


محاكاة العالم


World Model


فهم الفضاء والزمان والسببية


World Labs وGoogle وMeta وNVIDIA


محاكاة العالم الحقيقي


Robotics / Physical AI


التحكم في الروبوت


Google وNVIDIA وغيرها


الدخول إلى العالم الحقيقي


Spatial Intelligence


فهم الفضاء ثلاثي الأبعاد


World Labs وغيرها


فهم الآلة الحقيقي للفضاء


Edge AI


التشغيل المحلي


Apple وGoogle وQualcomm وNVIDIA وغيرها


دخول الذكاء الاصطناعي إلى الطرفية


لذلك فالمشهد اليوم ليس:


“لقد دخل الذكاء الاصطناعي عصر نموذج العالم، وانتهى عصر النماذج الكبيرة.”


والأدق أن نقول:


لا يزال LLM جوهرًا مهمًا جدًا في الذكاء الاصطناعي اليوم، لكنه يتحول إلى مكوّن داخل نظام أكبر للذكاء الاصطناعي.


الفرق بين هاتين الجملتين كبير جدًا.



العاشر، OpenAI: الانتقال من “النموذج اللغوي” إلى “الوكيل العام”


يمكن فهم مسار OpenAI الحالي ببساطة على النحو التالي:


Vision Reasoning


أي:


جعل الذكاء الاصطناعي لا يقتصر على القدرة على الإجابة عن:


“كيف؟”


بل مباشرةً:


“سأفعلها بدلًا منك.”


هذا هو التحول إلى Agent.


قد لا يعطيك ذكاء اصطناعي مستقبلي مقطع كود، بل:



  1. فهم المتطلبات


  2. البحث عن المواد


  3. كتابة الكود


  4. تشغيل الكود


  5. البحث عن الأخطاء


  6. التعديل


  7. الاختبار


  8. النشر


  9. تقرير النتائج


لذلك فإن ما يركز عليه OpenAI الآن لم يعد يشبه كثيرًا “روبوت الدردشة” بالمعنى التقليدي.


بل أشبه بـ:


عامل عام داخل العالم الرقمي.


لقد غطت أحدث منظومة نماذج OpenAI بالفعل مجالات الاستدلال، واستخدام الحاسوب، والتصفح، وهندسة البرمجيات، والصوت الفوري، وتوليد الصور، وغيرها.



الحادي عشر، Anthropic: تحويل الذكاء الاصطناعي إلى “وكيل عمل طويل الأمد”


كما أن مسار Anthropic واضح جدًا.


Claude ينتقل من:


مساعد دردشة


إلى:


منفذ مهام طويلة الدورة


التطور.


وخاصةً في:



  • Coding


  • Computer Use


  • Long-horizon tasks


  • Agentic workflows


  • العمل المعرفي المؤسسي


في الاستثمار على.


تؤكد سلسلة Claude 5.5 الأحدث بوضوح على Agentic Coding وقدرات العمل طويل الدورة.


إذا كان الذكاء الاصطناعي المبكر هو:


“أنت تسأل وأنا أجيب.”


الآن أصبح الأمر أشبه بـ:


“أنت تعطيني مشروعًا، وأنا أنجزه بنفسي.”



الثاني عشر، Google DeepMind: ربما المسار الأكثر اكتمالًا


مسار Google مثير جدًا للاهتمام.


لأن Google تمتلك في الوقت نفسه:



  • Gemini


  • البحث


  • YouTube


  • Android


  • Waymo


  • DeepMind


  • TPU


  • أبحاث الروبوتات


  • أبحاث نموذج العالم


لذلك لم تحصر Google الذكاء الاصطناعي في روبوتات الدردشة.


تُقسّم Google DeepMind حاليًا اتجاهاتها البحثية بوضوح إلى:


Foundation Models


↓


Multimodal AI


↓


Agents


↓


World Models


↓


Robotics / Physical AI


أصبحت منظومة نماذج Google الأحدث تتضمن بوضوح Genie 3 World Model، وكذلك Gemini Robotics 2.


تذهب Gemini Robotics 2 خطوة أبعد، إذ تربط بين الرؤية واللغة والاستدلال الفضائي وحركة الروبوت:


رؤية الأشياء → فهم البيئة → وضع خطة → التحكم في الروبوت.


لم يعد هذا Chatbot بالمعنى التقليدي.



الثالث عشر، Meta: V-JEPA يمثل مسارًا آخر لنموذج العالم


مسار World Labs ليس:


ما تفعله V-JEPA 2 ليس ببساطة جعل الذكاء الاصطناعي يولد فيديو جميلًا.


بل هو:


جعل الذكاء الاصطناعي يتعلم من الفيديو كيف يتغير العالم.


مثل:


كوب يسقط إلى الأسفل.


لا ينبغي للذكاء الاصطناعي أن يعرف فقط:


“هذا كوب.”


الأجدر أن نتوقع:


“إلى أين سيسقط بعد ذلك؟”


ولهذا فإن ما يستحق المتابعة فعلًا في هذه المرة من لي فاي-فاي ليس أنها ذهبت إلى AMD.


Prediction of the World


وضعت Meta V-JEPA 2 كنوع من نموذج العالم الذاتي الإشراف، يمكنه فهم وتوقع تغيرات البيئة، واستخدام ذلك لاحقًا في التحكم بالروبوتات.


وهذا قريب جدًا مما تقوله لي فاي-فاي.



الرابع عشر، NVIDIA: الرهان المباشر على Physical AI


إذا كان OpenAI يدرس:


الذكاء داخل العالم الرقمي.


إذن فإن NVIDIA تراهن بوضوح الآن على:


الذكاء داخل العالم المادي.


يُعد NVIDIA Cosmos مثالًا نموذجيًا.


تم وضع Cosmos 3 بالفعل كنموذج أساسي مفتوح لـ Physical AI، ويغطي:



  • World Generation


  • Action Prediction


  • World Simulation


  • Synthetic Data


  • Robotics


  • طالما كانت البيانات كثيرة بما يكفي، والحوسبة قوية بما يكفي، والشبكات العصبية كبيرة بما يكفي، يمكن للآلة أن تتعلم الأنماط البصرية المعقدة بنفسها.


وهذا يعني أن تدريب الروبوتات مستقبلًا قد لا يكون:


جعل الروبوت يسقط مليون مرة فعلًا.


بل هو:


السقوط مليون مرة في عالم افتراضي مولد بالذكاء الاصطناعي.


ثم نقل الاستراتيجية التي تعلمها إلى العالم الحقيقي.


وهذا سيخفض تكلفة تدريب الروبوتات بشكل كبير.



الخامس عشر، World Labs: ما الذي تراهن عليه لي فاي-فاي حقًا؟


والآن إذا عدنا بالنظر، يمكننا فهم لماذا كانت خطوة لي فاي-فاي هذه جديرة جدًا بالاهتمام.


نموذج الروبوت


إعادة صنع ChatGPT آخر.


بل هو:


إتاحة الذكاء الفضائي للآلة.


يُعد Atlas الأحدث من World Labs نموذجًا شديد التمثيل بالفعل.


إنه ليس مجرد مولّد فيديو.


يمكن لـ Atlas التعامل مع:


النص + الصورة + الفيديو + 3D + موضع الكاميرا + العمق


ويضع هذه المعلومات في سياق فضائي موحّد.


يمكنه أن:



  • إعادة بناء عالم ثلاثي الأبعاد من الصور


  • توليد زوايا رؤية جديدة


  • فهم العلاقات المكانية


  • محاكاة الفضاء والزمان


  • توليد بيئات قابلة لاستخدامها في تدريب الروبوتات


هذا هو:


World Model


نموذج العالم.



السادس عشر، لماذا قد يكون “نموذج العالم” هو المحطة التالية للذكاء الاصطناعي؟


لأن LLM لديه قيد طبيعي.


أكثر ما يعرفه من بيانات هو:


Token.


مثل:


يوجد كوب على الطاولة.


يمكن للنموذج فهم هذه الجملة.


لكن مشكلة العالم الحقيقي هي:


كم سنتيمترًا يفصل الكوب عن حافة الطاولة؟


ما وزن الكوب؟


من أي زاوية تمتد اليد؟


بعد أن يلمس اليد الكوب، هل سينقلب الكوب؟


إذا اصطدمت الطاولة، فماذا سيحدث للكوب؟


هذه ليست مشكلات لغوية بحتة.


وهي:


الفضاء + الزمان + الفيزياء + السببية + الفعل


مشكلة.


لذلك:


يفهم النموذج اللغوي “العالم كما يصفه البشر”.


أما نموذج العالم فيحاول فهم:


“كيف يعمل العالم نفسه.”


وهذا هو الفرق الجوهري بين الاثنين.



السابع عشر، ولهذا تقول لي فاي-فاي:


“العالم ليس مصنوعًا من الكلمات.”


هذه العبارة تستحق الفهم المتكرر بالفعل.


لأننا خلال السنوات الماضية ارتكبنا خطأ يمكن فهمه بسهولة:


نحن ندمج:


الذكاء الاصطناعي = LLM


لكن في الحقيقة:


LLM مجرد وعاء واحد من أوعية الذكاء.


ذكاء الإنسان لم يكن لغة فقط أصلًا.


عندما يبدأ الإنسان بالتعلم وهو صغير:


ليس أن يقرأ أولًا 10 مليارات Token.


بل هو:


انظر.


استمع.


اللمس.


التحرك.


السقوط.


مراقبة الآخرين.


النتائج المتوقعة.


المحاولة والخطأ باستمرار.


وفي النهاية يتشكل نموذج داخلي للعالم.



الثامن عشر، لذلك قد تكون المرحلة التالية للذكاء الاصطناعي هي “عصر الحواس الخمس”


إذا فككنا مستقبل الذكاء الاصطناعي بشكل أدق، فسيصبح تقريبًا:


الطبقة الأولى: Language


فهم اللغة.


↓


الطبقة الثانية: Vision


فهم الصور.


↓


الطبقة الثالثة: Audio


فهم الأصوات.


↓


الطبقة الرابعة: Video


فهم تغيّرات العالم المتواصلة.


↓


الطبقة الخامسة: 3D / Spatial


فهم الفضاء.


↓


الطبقة السادسة: World Model


فهم كيفية عمل العالم.


↓


الطبقة السابعة: Action


اتخاذ الإجراء.


↓


الطبقة الثامنة: Physical AI


تنفيذ الأفعال في العالم الحقيقي.


عندها فقط انتقل الذكاء الاصطناعي حقًا من:


“الدماغ”


بدأت تتحول إلى:


“دماغ + عينان + أذنان + يدان + جسم.”



التاسع عشر، لذلك فإن ما يستحق المتابعة مستقبلًا حقًا ليس “من يملك أكبر عدد من معاملات النموذج”


هذه هي النقطة التي أعتقد أن المقال يستحق أن نوسّعها أكثر.


المنافسة السابقة في الذكاء الاصطناعي:


عدد المعاملات.


ثم لاحقًا:


Benchmark.


ثم لاحقًا:


قدرة الاستدلال.


الآن:


وكيل.


الخطوة التالية:


World Model + Physical AI.


وبالتالي ستتغير سلسلة صناعة الذكاء الاصطناعي.


كان الأهم في الماضي هو:


البيانات → GPU → النماذج الكبيرة → Chatbot


قد تصبح في المستقبل:


البيانات → النموذج الأساسي → نموذج العالم → المحاكاة → الوكيل → الروبوت → العالم الحقيقي


وهذا يفسر أيضًا لماذا بدأت شركات الرقائق تقترب بجنون من طبقة النماذج.


لأن:


أفضل الرقائق مستقبلًا قد لا تقتصر على تشغيل النماذج الكبيرة الحالية، بل قد تحدد أيضًا ما الذي سيفهمه الجيل القادم من الذكاء الاصطناعي، وما الذي سيماثله، وما الذي سيفعله.



العشرون، ولهذا السبب تريد AMD إنفاق 8.2 مليار دولار لشراء World Labs


أهم ما يستحق النظر في هذه الصفقة، ليس مبلغ 8.2 مليار دولار نفسه.


بل موقعه داخل سلسلة الصناعة.


أعلنت World Labs رسميًا أنها تعاونت سابقًا بعمق تقني مع AMD، بما في ذلك تدريب النماذج وتحسين الاستدلال على وحدات AMD GPU.


أما الآن فقد اندمج الطرفان مباشرة.


ستصبح لي فاي-فاي نائبة الرئيس التنفيذي وكبيرة العلماء في AMD، بينما يواصل فريق World Labs العمل على الأبحاث النموذجية ذات الصلة. ومن المتوقع إتمام الصفقة في نهاية 2026، ولا تزال بحاجة إلى موافقة الجهات التنظيمية.


والمنطق الذي تقدمه AMD نفسها مباشر جدًا أيضًا:


مع دخول الذكاء الاصطناعي إلى:


الاستدلال، الروبوتات، المحاكاة، Physical AI


ستتغير متطلبات الحوسبة.


لذلك يجب على شركات الرقائق أن تفهم بعمق أكبر:


الشكل الحقيقي للنموذج المستقبلي.


هذه العبارة أهم من 8.2 مليار دولار نفسها.



الحادي والعشرون، لذلك يمكن اختصار مسار تطور الذكاء الاصطناعي الحقيقي في هذه الصورة


1950s


ذكاء اصطناعي قائم على القواعد


│


│ جعل الآلة تنفذ القواعد التي كتبها الإنسان


▼


2012


التعلم العميق


│


│ جعل الآلة تتعلم من البيانات


▼


2016


التعلم المعزز


│


│ جعل الآلة تشكّل استراتيجية عبر التجربة والخطأ


▼


2017


Transformer


│


│ جعل النماذج واسعة النطاق ممكنة


▼


2020


GPT-3


│


│ بدأت النماذج الأساسية تُظهر قدرات عامة


▼


2021-2022


Generative AI


│


│ نص → صورة → صوت → فيديو


▼


2022-2024


LLM


│


│ أصبح الذكاء الاصطناعي مساعد معرفة عام


▼


2024-2026


Reasoning


│


│ بدأ الذكاء الاصطناعي “يفكر”


▼


2025-2026


AI Agent


│


│ بدأ الذكاء الاصطناعي “يفعل الأشياء”


▼


يتسارع


World Model


│


│ بدأ الذكاء الاصطناعي يفهم الفضاء والزمان والسببية


▼


المرحلة التالية


Physical AI


│


│ بدأ الذكاء الاصطناعي يتحكم في الروبوتات


▼


المستقبل الأبعد


Embodied Intelligence


│


│ الذكاء الاصطناعي يدخل العالم الحقيقي فعلاً



الثاني والعشرون، وبحلول 2026 يكون الذكاء الاصطناعي في الواقع عند “نقطة تقاطع”


وهذا هو الجزء الأسهل أن يتم تجاهله.


اليوم لم ينتهِ عصر LLM.


بل على العكس.


من المرجح جدًا ألا يكون المستقبل:


تم استبدال LLM بـWorld Model.


بل هو:


أصبح LLM جزءًا من World Model.


من المرجح أن يمتلك نظام ذكاء اصطناعي مستقبلي قوي حقًا في الوقت نفسه:


النموذج اللغوي


مسؤول عن فهم نية الإنسان.


نموذج بصري


مسؤول عن الملاحظة.


نموذج العالم


مسؤول عن التنبؤ بالبيئة.


نموذج الاستدلال


مسؤول عن وضع الخطط.


Agent


مسؤول عن استدعاء الأدوات.


وهذا هو Generative AI.


مسؤول عن تنفيذ الأفعال.


الرقائق


مسؤول عن تشغيل كل هذا لحظيًا.


وفي النهاية يتشكل:


Perception → Reasoning → Simulation → Planning → Action


أي:


الإدراك → التفكير → المحاكاة → التخطيط → العمل.



الثالث والعشرون، لذلك فإن محطة الذكاء الاصطناعي التالية قد لا تكون “النموذج الأكبر”


بل هو:


ذكاء أكثر اكتمالًا.


كنا نسأل دائمًا في الماضي:


“كم عدد معاملات هذا النموذج؟”


قد يكون من الأجدر مستقبلًا أن نسأل أكثر:


“كم يفهم هذا الذكاء الاصطناعي من العالم؟”


في السابق كنا نقارن:


لمن تكون الإجابة أفضل؟


قد تتم المقارنة مستقبلًا بين:


من يستطيع إتمام مهمة معقدة فعلًا؟


كان الذكاء الاصطناعي موجودًا في:


داخل نافذة ChatGPT.


قد يوجد الذكاء الاصطناعي مستقبلاً في:


في السيارات والروبوتات والمصانع والمستشفيات والألعاب والمباني والطائرات المسيّرة وأجهزة الحوسبة المكانية وفي العالم المادي بأكمله.



وأخيرًا، لخص تطور الذكاء الاصطناعي خلال هذه السبعين سنة في جملة واحدة


في البداية كان الذكاء الاصطناعي يتعلم قواعد البشر؛ ثم تعلّم الرؤية البشرية؛ ثم تعلّم اللغة البشرية؛ والآن بدأ يتعلم الاستدلال البشري؛ أما المرحلة التالية، فالذي يحتاج أن يتعلمه حقًا هو العالم الذي يعيش فيه البشر.


LLM → Reasoning → Multimodal → Agent → Computer Use → General Intelligence


بل هو:


عالِمة كرّست أكثر من 20 عامًا لجعل الآلة ترى، وتبدأ الآن بنقل الهدف من “الرؤية” إلى “فهم الفضاء، فهم العالم، فهم الواقع”.


ومن Google Genie 3 وGemini Robotics إلى Meta V-JEPA 2، ثم NVIDIA Cosmos وWorld Labs Atlas، يمكننا رؤية اتجاه صناعي واضح جدًا:


ساحة الذكاء الاصطناعي تتمدّد من “المعلومات الرقمية” إلى “العالم الحقيقي”.


قد يكون هذا هو محور التركيز الأهم للذكاء الاصطناعي في السنوات القليلة القادمة.


النماذج الكبيرة تحل سؤال: “هل يعرف الذكاء الاصطناعي كيف يتكلم؟”؛ والوكيل يحل سؤال: “هل يعرف الذكاء الاصطناعي كيف يفعل؟”؛ أما نموذج العالم فيحل سؤالًا ربما يكون الأهم: “هل يفهم الذكاء الاصطناعي هذا العالم فعلًا؟”