أولًا، المرحلة الأولى: جعل الآلات «ترى» — عصر القواعد → عصر الإدراك
في الحقيقة، بدأت قصة الذكاء الاصطناعي منذ وقتٍ طويل.
يُنظر عادةً إلى مؤتمر دارتموث عام 1956 باعتباره نقطة البداية المهمة لظهور الذكاء الاصطناعي الحديث كمجال بحثي مستقل. في ذلك الوقت، كان الذكاء الاصطناعي يعتمد أكثر على وضع الإنسان للقواعد يدويًا، مع الأمل في كتابة منطق البشر مباشرةً في الآلة.
المشكلة الجوهرية في هذا العصر هي:
«هل يمكنني أن أخبر الآلة بما يجب أن تفعله؟»
مثلًا:
إذا كان A، إذن B؛
إذا رأى سمةً ما، فسيُحكم أنها جسمٌ ما؛
إذا تحققت بعض الشروط، فسيتم تنفيذ إجراءٍ ما.
كما أن المشكلة واضحة جدًا:
العالم الحقيقي معقد جدًا.
يمكن للإنسان أن يحكم بسهولة:
“هذه قطة.”
لكن يصعب جدًا أن تكتب “ما هو القط” على شكل مئات الآلاف من القواعد.
وهكذا بدأ الذكاء الاصطناعي ينتقل من:
جعل الآلة تنفذ القواعد التي كتبها الإنسان
التحول إلى:
لجعل الآلة تتعلم الأنماط بنفسها من البيانات.
وهذا هو السبب الجذري لظهور التعلم الآلي ثم التعلم العميق لاحقًا.
الثاني، 2012: الذكاء الاصطناعي “يفهم العالم” لأول مرة فعلًا
كان ImageNet في عام 2012 نقطة تحول شديدة الأهمية.
استخدم AlexNet شبكة عصبية التفافية عميقة وحقق اختراقًا في مهمة التعرف على الصور واسعة النطاق، مما جعل الصناعة كلها تعيد إدراك أن:
أنت تعطيه جملة، فيتنبأ بالجملة التالية.
وبعد هذا دخل الذكاء الاصطناعي عصر التعلم العميق.
ولهذا ظهرت مجموعة كبيرة من القدرات التي اعتدنا عليها اليوم:
تصنيف الصور
التعرّف على الوجوه
OCR
الرؤية في القيادة الذاتية
التعرّف على الصور الطبية
فهم الفيديو
أنظمة التوصية
أكثر ما يبرع فيه الذكاء الاصطناعي في هذه المرحلة هو:
التعرّف.
أعطه صورة، فيخبرك:
“هذا قط.”
تعطيه مقطعًا صوتيًا، فيخبرك:
“هذا ما قلته.”
إذا أعطيته صورة أشعة، فإنه يحكم على:
“يوجد هنا شذوذ.”
لكنه لم يكن قد فهم هذا العالم حقًا بعد.
إنه فقط صار أفضل في استخراج الأنماط من المدخلات.
الثالث، 2016: AlphaGo أخبر العالم أن الذكاء الاصطناعي لا يستطيع التعرّف فقط، بل يمكنه أيضًا “التفكير”
في عام 2016، كان انتصار AlphaGo على لي سيدول نقطة مفصلية أخرى ضخمة في تاريخ الذكاء الاصطناعي.
لم يكن AlphaGo مجرد حفظ سجلات اللعب.
إنه يحول:
الشبكات العصبية العميقة + البحث + التعلم المعزز
دمجها معًا.
لقد تعلّم من سجلات البشر في الشطرنج، ثم واصل التعلم عبر اللعب مع نفسه. وفي النهاية كوّن، داخل فضاء البحث الهائل في لعبة Go، استراتيجية تجاوزت أفضل لاعبي العالم.
تكمن أهمية هذا الأمر في:
أظهر الذكاء الاصطناعي لأول مرة وعلى نطاق واسع:
لا تستطيع الآلة فقط التعرّف على الأنماط، بل يمكنها أيضًا تشكيل استراتيجية عبر التدريب والبحث والتغذية الراجعة والتجربة والخطأ.
وهكذا بدأت قدرات الذكاء الاصطناعي تنتقل من:
Perception الإدراك
إلى:
القرار Decision
تطور.
وقد زرع هذا البذور لاحقًا للتعلم المعزز، ونماذج الاستدلال، وAI Agent.
الرابع، 2017: Transformer غيّر صناعة الذكاء الاصطناعي بأكملها
إذا كان عام 2012 هو انفجار عصر التعلم العميق، فإن 2017 كان بالفعل الأساس التقني الحقيقي لعصر النماذج الكبيرة اليوم.
في هذا العام، نشر فريق Google ورقة بحثية:
(Attention Is All You Need)
طرح Transformer.
أكبر تغيير فيه أنه وضع “Attention” في قلب النموذج، كما أنه مناسب جدًا للتدريب المتوازي واسع النطاق.
لاحقًا بُني تقريبًا عالم الذكاء الاصطناعي التوليدي كله على هذا المسار التقني:
Transformer → GPT → LLM → نموذج متعدد الوسائط → Agent → نموذج العالم
لذلك فإن ما نراه اليوم من ChatGPT وClaude وGemini لم يظهر فجأة.
إنها في الواقع تمثل العقود الماضية من:
البيانات + الشبكات العصبية + GPU + Transformer + Scaling
نتيجة التراكم المشترك.
الخامس، 2020: أثبت GPT-3 شيئًا مهمًا جدًا
في عام 2020، أطلقت OpenAI نموذج GPT-3.
175 مليار معلمة.
أهميته ليست فقط لأنه “كبير”.
الأمر المهم حقًا هو:
بعد تضخم حجم النماذج، ظهرت قدرات عامة أقوى وأقوى من نوع “الانبثاق”.
أصبح GPT-3 قادرًا على إنجاز مهام مختلفة عبر عدد قليل من الأمثلة، دون الحاجة إلى إعادة تدريب النموذج لكل مهمة على حدة.
وهذا غيّر المسار البحثي لصناعة الذكاء الاصطناعي.
كان الناس يفكرون سابقًا أن:
تدريب نموذج واحد لمهمة واحدة.
ثم تحولت تدريجيًا إلى:
تدريب نموذج أساسي ضخم بما يكفي، ثم جعله يتكيف مع عدد كبير من المهام.
وهنا ظهر مفهوم مهم جدًا:
Foundation Model
النماذج الأساسية.
وهذا أيضًا هو جوهر انفجار الذكاء الاصطناعي في السنوات الماضية.
السادس، 2021—2022: بدأ الذكاء الاصطناعي ينتقل من “فهم النص” إلى “توليد العالم”
هذه المرحلة مهمة جدًا، لأن الذكاء الاصطناعي بدأ يتجاوز النص البحت.
كان DALL·E من OpenAI قادرًا بالفعل على توليد الصور من النص.
ثم:
Stable Diffusion
Midjourney
DALL·E
Imagen
Sora
Veo
الاستمرار في نقل قدرة الذكاء الاصطناعي على التوليد من:
نص → صورة → فيديو → صوت → 3D
التوسع إلى الخارج.
وهكذا بدأ الذكاء الاصطناعي يظهر تغيرًا واضحًا جدًا:
في السابق كان الأمر:
الذكاء الاصطناعي يفهم المحتوى الذي يبدعه البشر.
الآن أصبح:
الذكاء الاصطناعي يبتكر المحتوى بنفسه.
هذا هو Generative AI.
السابع، نهاية 2022: ChatGPT أدخل الذكاء الاصطناعي إلى عصر الجماهير
بعد 2022، دخل الذكاء الاصطناعي بالفعل حياة الناس العاديين.
أكبر اختراق لـ ChatGPT لم يكن أول ظهور لنموذج لغوي.
بل تحويل عدد كبير من القدرات المعقدة للذكاء الاصطناعي إلى:
واجهة يمكن لشخص عادي التحدث معها مباشرة.
من هذه اللحظة:
أصبح الذكاء الاصطناعي أول مرة أداة إنتاجية جماهيرية فعلًا.
كتابة المقالات، كتابة الكود، الترجمة، التلخيص، التحليل، البحث، التعلم……
كل شيء بدأ يدور حول:
“أنت تخبر الذكاء الاصطناعي بما تريد فعله.”
توسيع.
ولذلك، تنافست صناعة الذكاء الاصطناعي خلال السنوات الماضية تقريبًا حول سؤال واحد:
من يملك نموذجًا أكبر وأقوى؟
الثامن، 2023—2025: بدأ الذكاء الاصطناعي يتطور من “الدردشة” إلى “الاستدلال”
وهذه في الحقيقة هي الخطوة الأهم الآن لفهم الذكاء الاصطناعي.
كانت النماذج الكبيرة المبكرة أشبه بـ:
متنبئ لغوي فائق.
مسار بحث Meta جدير جدًا بالاهتمام.
لكن لاحقًا بدأ البحث يولي اهتمامًا أكبر لـ:
Chain of Thought
Reinforcement Learning
Test-time Compute
Reasoning
Tool Use
Planning
Long-horizon tasks
أي:
لم يعد الذكاء الاصطناعي يكتفي بـ:
“أعطيك جوابًا.”
وبدأت تحاول:
“دعني أفكر قليلًا أولًا، ثم أنجز هذه المهمة.”
وهذا هو Reasoning Model.
بحلول 2026، أصبحت بوضوح نقطة التركيز في المنافسة بين OpenAI وAnthropic وGoogle وغيرها من المختبرات الرائدة تنتقل من مجرد قدرات الدردشة إلى:
استدلال معقد + برمجة + استدعاء أدوات + مهام طويلة + Agent.
على سبيل المثال، يؤكد GPT-6 Astra الأحدث من OpenAI على قدرات مثل الرياضيات، وهندسة البرمجيات، وتشغيل الحاسوب، وتشغيل المتصفح، والعمل المهني؛ كما تواصل OpenAI تحسين النماذج والبنية التحتية للاستدلال وAgentic Harness.
كما أن سلسلة Claude 5.5 الأحدث من Anthropic تؤكد بوضوح على الأعمال المعقدة، والمهام طويلة الدورة، وAgentic Coding.
وهذا يعني:
لقد انتقل الذكاء الاصطناعي من “الإجابة عن الأسئلة” إلى “إتمام المهام”.
هذه نقطة فاصلة مهمة جدًا اليوم.
التاسع، إذن إلى أين وصل الذكاء الاصطناعي السائد الآن؟
إذا رسمنا صناعة الذكاء الاصطناعي في 2026 على شكل خريطة، فيمكن تقسيمها تقريبًا إلى المسارات التالية.
مسار الذكاء الاصطناعي
القدرة الأساسية الحالية
يمثل اللاعبين
الخطوة التالية
LLM
اللغة، المعرفة، الاستدلال
OpenAI وAnthropic وGoogle
استدلال أقوى، Agent
Multimodal
نص + صورة + صوت + فيديو
OpenAI وGoogle وMeta وMistral
تمثيل موحّد للعالم
AI Agent
تنفيذ المهام تلقائيًا
OpenAI وAnthropic وGoogle
العمل الذاتي طويل الدورة
Coding Agent
كتابة الكود، تعديل الكود، النشر
OpenAI وAnthropic وGoogle وغيرها
أتمتة هندسة البرمجيات
Video World
توليد الفيديو، الفهم
Google وOpenAI وغيرها
محاكاة العالم
World Model
فهم الفضاء والزمان والسببية
World Labs وGoogle وMeta وNVIDIA
محاكاة العالم الحقيقي
Robotics / Physical AI
التحكم في الروبوت
Google وNVIDIA وغيرها
الدخول إلى العالم الحقيقي
Spatial Intelligence
فهم الفضاء ثلاثي الأبعاد
World Labs وغيرها
فهم الآلة الحقيقي للفضاء
Edge AI
التشغيل المحلي
Apple وGoogle وQualcomm وNVIDIA وغيرها
دخول الذكاء الاصطناعي إلى الطرفية
لذلك فالمشهد اليوم ليس:
“لقد دخل الذكاء الاصطناعي عصر نموذج العالم، وانتهى عصر النماذج الكبيرة.”
والأدق أن نقول:
لا يزال LLM جوهرًا مهمًا جدًا في الذكاء الاصطناعي اليوم، لكنه يتحول إلى مكوّن داخل نظام أكبر للذكاء الاصطناعي.
الفرق بين هاتين الجملتين كبير جدًا.
العاشر، OpenAI: الانتقال من “النموذج اللغوي” إلى “الوكيل العام”
يمكن فهم مسار OpenAI الحالي ببساطة على النحو التالي:
Vision Reasoning
أي:
جعل الذكاء الاصطناعي لا يقتصر على القدرة على الإجابة عن:
“كيف؟”
بل مباشرةً:
“سأفعلها بدلًا منك.”
هذا هو التحول إلى Agent.
قد لا يعطيك ذكاء اصطناعي مستقبلي مقطع كود، بل:
فهم المتطلبات
البحث عن المواد
كتابة الكود
تشغيل الكود
البحث عن الأخطاء
التعديل
الاختبار
النشر
تقرير النتائج
لذلك فإن ما يركز عليه OpenAI الآن لم يعد يشبه كثيرًا “روبوت الدردشة” بالمعنى التقليدي.
بل أشبه بـ:
عامل عام داخل العالم الرقمي.
لقد غطت أحدث منظومة نماذج OpenAI بالفعل مجالات الاستدلال، واستخدام الحاسوب، والتصفح، وهندسة البرمجيات، والصوت الفوري، وتوليد الصور، وغيرها.
الحادي عشر، Anthropic: تحويل الذكاء الاصطناعي إلى “وكيل عمل طويل الأمد”
كما أن مسار Anthropic واضح جدًا.
Claude ينتقل من:
مساعد دردشة
إلى:
منفذ مهام طويلة الدورة
التطور.
وخاصةً في:
Coding
Computer Use
Long-horizon tasks
Agentic workflows
العمل المعرفي المؤسسي
في الاستثمار على.
تؤكد سلسلة Claude 5.5 الأحدث بوضوح على Agentic Coding وقدرات العمل طويل الدورة.
إذا كان الذكاء الاصطناعي المبكر هو:
“أنت تسأل وأنا أجيب.”
الآن أصبح الأمر أشبه بـ:
“أنت تعطيني مشروعًا، وأنا أنجزه بنفسي.”
الثاني عشر، Google DeepMind: ربما المسار الأكثر اكتمالًا
مسار Google مثير جدًا للاهتمام.
لأن Google تمتلك في الوقت نفسه:
Gemini
البحث
YouTube
Android
Waymo
DeepMind
TPU
أبحاث الروبوتات
أبحاث نموذج العالم
لذلك لم تحصر Google الذكاء الاصطناعي في روبوتات الدردشة.
تُقسّم Google DeepMind حاليًا اتجاهاتها البحثية بوضوح إلى:
Foundation Models
↓
Multimodal AI
↓
Agents
↓
World Models
↓
Robotics / Physical AI
أصبحت منظومة نماذج Google الأحدث تتضمن بوضوح Genie 3 World Model، وكذلك Gemini Robotics 2.
تذهب Gemini Robotics 2 خطوة أبعد، إذ تربط بين الرؤية واللغة والاستدلال الفضائي وحركة الروبوت:
رؤية الأشياء → فهم البيئة → وضع خطة → التحكم في الروبوت.
لم يعد هذا Chatbot بالمعنى التقليدي.
الثالث عشر، Meta: V-JEPA يمثل مسارًا آخر لنموذج العالم
مسار World Labs ليس:
ما تفعله V-JEPA 2 ليس ببساطة جعل الذكاء الاصطناعي يولد فيديو جميلًا.
بل هو:
جعل الذكاء الاصطناعي يتعلم من الفيديو كيف يتغير العالم.
مثل:
كوب يسقط إلى الأسفل.
لا ينبغي للذكاء الاصطناعي أن يعرف فقط:
“هذا كوب.”
الأجدر أن نتوقع:
“إلى أين سيسقط بعد ذلك؟”
ولهذا فإن ما يستحق المتابعة فعلًا في هذه المرة من لي فاي-فاي ليس أنها ذهبت إلى AMD.
Prediction of the World
وضعت Meta V-JEPA 2 كنوع من نموذج العالم الذاتي الإشراف، يمكنه فهم وتوقع تغيرات البيئة، واستخدام ذلك لاحقًا في التحكم بالروبوتات.
وهذا قريب جدًا مما تقوله لي فاي-فاي.
الرابع عشر، NVIDIA: الرهان المباشر على Physical AI
إذا كان OpenAI يدرس:
الذكاء داخل العالم الرقمي.
إذن فإن NVIDIA تراهن بوضوح الآن على:
الذكاء داخل العالم المادي.
يُعد NVIDIA Cosmos مثالًا نموذجيًا.
تم وضع Cosmos 3 بالفعل كنموذج أساسي مفتوح لـ Physical AI، ويغطي:
World Generation
Action Prediction
World Simulation
Synthetic Data
Robotics
طالما كانت البيانات كثيرة بما يكفي، والحوسبة قوية بما يكفي، والشبكات العصبية كبيرة بما يكفي، يمكن للآلة أن تتعلم الأنماط البصرية المعقدة بنفسها.
وهذا يعني أن تدريب الروبوتات مستقبلًا قد لا يكون:
جعل الروبوت يسقط مليون مرة فعلًا.
بل هو:
السقوط مليون مرة في عالم افتراضي مولد بالذكاء الاصطناعي.
ثم نقل الاستراتيجية التي تعلمها إلى العالم الحقيقي.
وهذا سيخفض تكلفة تدريب الروبوتات بشكل كبير.
الخامس عشر، World Labs: ما الذي تراهن عليه لي فاي-فاي حقًا؟
والآن إذا عدنا بالنظر، يمكننا فهم لماذا كانت خطوة لي فاي-فاي هذه جديرة جدًا بالاهتمام.
نموذج الروبوت
إعادة صنع ChatGPT آخر.
بل هو:
إتاحة الذكاء الفضائي للآلة.
يُعد Atlas الأحدث من World Labs نموذجًا شديد التمثيل بالفعل.
إنه ليس مجرد مولّد فيديو.
يمكن لـ Atlas التعامل مع:
النص + الصورة + الفيديو + 3D + موضع الكاميرا + العمق
ويضع هذه المعلومات في سياق فضائي موحّد.
يمكنه أن:
إعادة بناء عالم ثلاثي الأبعاد من الصور
توليد زوايا رؤية جديدة
فهم العلاقات المكانية
محاكاة الفضاء والزمان
توليد بيئات قابلة لاستخدامها في تدريب الروبوتات
هذا هو:
World Model
نموذج العالم.
السادس عشر، لماذا قد يكون “نموذج العالم” هو المحطة التالية للذكاء الاصطناعي؟
لأن LLM لديه قيد طبيعي.
أكثر ما يعرفه من بيانات هو:
Token.
مثل:
يوجد كوب على الطاولة.
يمكن للنموذج فهم هذه الجملة.
لكن مشكلة العالم الحقيقي هي:
كم سنتيمترًا يفصل الكوب عن حافة الطاولة؟
ما وزن الكوب؟
من أي زاوية تمتد اليد؟
بعد أن يلمس اليد الكوب، هل سينقلب الكوب؟
إذا اصطدمت الطاولة، فماذا سيحدث للكوب؟
هذه ليست مشكلات لغوية بحتة.
وهي:
الفضاء + الزمان + الفيزياء + السببية + الفعل
مشكلة.
لذلك:
يفهم النموذج اللغوي “العالم كما يصفه البشر”.
أما نموذج العالم فيحاول فهم:
“كيف يعمل العالم نفسه.”
وهذا هو الفرق الجوهري بين الاثنين.
السابع عشر، ولهذا تقول لي فاي-فاي:
“العالم ليس مصنوعًا من الكلمات.”
هذه العبارة تستحق الفهم المتكرر بالفعل.
لأننا خلال السنوات الماضية ارتكبنا خطأ يمكن فهمه بسهولة:
نحن ندمج:
الذكاء الاصطناعي = LLM
لكن في الحقيقة:
LLM مجرد وعاء واحد من أوعية الذكاء.
ذكاء الإنسان لم يكن لغة فقط أصلًا.
عندما يبدأ الإنسان بالتعلم وهو صغير:
ليس أن يقرأ أولًا 10 مليارات Token.
بل هو:
انظر.
استمع.
اللمس.
التحرك.
السقوط.
مراقبة الآخرين.
النتائج المتوقعة.
المحاولة والخطأ باستمرار.
وفي النهاية يتشكل نموذج داخلي للعالم.
الثامن عشر، لذلك قد تكون المرحلة التالية للذكاء الاصطناعي هي “عصر الحواس الخمس”
إذا فككنا مستقبل الذكاء الاصطناعي بشكل أدق، فسيصبح تقريبًا:
الطبقة الأولى: Language
فهم اللغة.
↓
الطبقة الثانية: Vision
فهم الصور.
↓
الطبقة الثالثة: Audio
فهم الأصوات.
↓
الطبقة الرابعة: Video
فهم تغيّرات العالم المتواصلة.
↓
الطبقة الخامسة: 3D / Spatial
فهم الفضاء.
↓
الطبقة السادسة: World Model
فهم كيفية عمل العالم.
↓
الطبقة السابعة: Action
اتخاذ الإجراء.
↓
الطبقة الثامنة: Physical AI
تنفيذ الأفعال في العالم الحقيقي.
عندها فقط انتقل الذكاء الاصطناعي حقًا من:
“الدماغ”
بدأت تتحول إلى:
“دماغ + عينان + أذنان + يدان + جسم.”
التاسع عشر، لذلك فإن ما يستحق المتابعة مستقبلًا حقًا ليس “من يملك أكبر عدد من معاملات النموذج”
هذه هي النقطة التي أعتقد أن المقال يستحق أن نوسّعها أكثر.
المنافسة السابقة في الذكاء الاصطناعي:
عدد المعاملات.
ثم لاحقًا:
Benchmark.
ثم لاحقًا:
قدرة الاستدلال.
الآن:
وكيل.
الخطوة التالية:
World Model + Physical AI.
وبالتالي ستتغير سلسلة صناعة الذكاء الاصطناعي.
كان الأهم في الماضي هو:
البيانات → GPU → النماذج الكبيرة → Chatbot
قد تصبح في المستقبل:
البيانات → النموذج الأساسي → نموذج العالم → المحاكاة → الوكيل → الروبوت → العالم الحقيقي
وهذا يفسر أيضًا لماذا بدأت شركات الرقائق تقترب بجنون من طبقة النماذج.
لأن:
أفضل الرقائق مستقبلًا قد لا تقتصر على تشغيل النماذج الكبيرة الحالية، بل قد تحدد أيضًا ما الذي سيفهمه الجيل القادم من الذكاء الاصطناعي، وما الذي سيماثله، وما الذي سيفعله.
العشرون، ولهذا السبب تريد AMD إنفاق 8.2 مليار دولار لشراء World Labs
أهم ما يستحق النظر في هذه الصفقة، ليس مبلغ 8.2 مليار دولار نفسه.
بل موقعه داخل سلسلة الصناعة.
أعلنت World Labs رسميًا أنها تعاونت سابقًا بعمق تقني مع AMD، بما في ذلك تدريب النماذج وتحسين الاستدلال على وحدات AMD GPU.
أما الآن فقد اندمج الطرفان مباشرة.
ستصبح لي فاي-فاي نائبة الرئيس التنفيذي وكبيرة العلماء في AMD، بينما يواصل فريق World Labs العمل على الأبحاث النموذجية ذات الصلة. ومن المتوقع إتمام الصفقة في نهاية 2026، ولا تزال بحاجة إلى موافقة الجهات التنظيمية.
والمنطق الذي تقدمه AMD نفسها مباشر جدًا أيضًا:
مع دخول الذكاء الاصطناعي إلى:
الاستدلال، الروبوتات، المحاكاة، Physical AI
ستتغير متطلبات الحوسبة.
لذلك يجب على شركات الرقائق أن تفهم بعمق أكبر:
الشكل الحقيقي للنموذج المستقبلي.
هذه العبارة أهم من 8.2 مليار دولار نفسها.
الحادي والعشرون، لذلك يمكن اختصار مسار تطور الذكاء الاصطناعي الحقيقي في هذه الصورة
1950s
ذكاء اصطناعي قائم على القواعد
│
│ جعل الآلة تنفذ القواعد التي كتبها الإنسان
▼
2012
التعلم العميق
│
│ جعل الآلة تتعلم من البيانات
▼
2016
التعلم المعزز
│
│ جعل الآلة تشكّل استراتيجية عبر التجربة والخطأ
▼
2017
Transformer
│
│ جعل النماذج واسعة النطاق ممكنة
▼
2020
GPT-3
│
│ بدأت النماذج الأساسية تُظهر قدرات عامة
▼
2021-2022
Generative AI
│
│ نص → صورة → صوت → فيديو
▼
2022-2024
LLM
│
│ أصبح الذكاء الاصطناعي مساعد معرفة عام
▼
2024-2026
Reasoning
│
│ بدأ الذكاء الاصطناعي “يفكر”
▼
2025-2026
AI Agent
│
│ بدأ الذكاء الاصطناعي “يفعل الأشياء”
▼
يتسارع
World Model
│
│ بدأ الذكاء الاصطناعي يفهم الفضاء والزمان والسببية
▼
المرحلة التالية
Physical AI
│
│ بدأ الذكاء الاصطناعي يتحكم في الروبوتات
▼
المستقبل الأبعد
Embodied Intelligence
│
│ الذكاء الاصطناعي يدخل العالم الحقيقي فعلاً
الثاني والعشرون، وبحلول 2026 يكون الذكاء الاصطناعي في الواقع عند “نقطة تقاطع”
وهذا هو الجزء الأسهل أن يتم تجاهله.
اليوم لم ينتهِ عصر LLM.
بل على العكس.
من المرجح جدًا ألا يكون المستقبل:
تم استبدال LLM بـWorld Model.
بل هو:
أصبح LLM جزءًا من World Model.
من المرجح أن يمتلك نظام ذكاء اصطناعي مستقبلي قوي حقًا في الوقت نفسه:
النموذج اللغوي
مسؤول عن فهم نية الإنسان.
نموذج بصري
مسؤول عن الملاحظة.
نموذج العالم
مسؤول عن التنبؤ بالبيئة.
نموذج الاستدلال
مسؤول عن وضع الخطط.
Agent
مسؤول عن استدعاء الأدوات.
وهذا هو Generative AI.
مسؤول عن تنفيذ الأفعال.
الرقائق
مسؤول عن تشغيل كل هذا لحظيًا.
وفي النهاية يتشكل:
Perception → Reasoning → Simulation → Planning → Action
أي:
الإدراك → التفكير → المحاكاة → التخطيط → العمل.
الثالث والعشرون، لذلك فإن محطة الذكاء الاصطناعي التالية قد لا تكون “النموذج الأكبر”
بل هو:
ذكاء أكثر اكتمالًا.
كنا نسأل دائمًا في الماضي:
“كم عدد معاملات هذا النموذج؟”
قد يكون من الأجدر مستقبلًا أن نسأل أكثر:
“كم يفهم هذا الذكاء الاصطناعي من العالم؟”
في السابق كنا نقارن:
لمن تكون الإجابة أفضل؟
قد تتم المقارنة مستقبلًا بين:
من يستطيع إتمام مهمة معقدة فعلًا؟
كان الذكاء الاصطناعي موجودًا في:
داخل نافذة ChatGPT.
قد يوجد الذكاء الاصطناعي مستقبلاً في:
في السيارات والروبوتات والمصانع والمستشفيات والألعاب والمباني والطائرات المسيّرة وأجهزة الحوسبة المكانية وفي العالم المادي بأكمله.
وأخيرًا، لخص تطور الذكاء الاصطناعي خلال هذه السبعين سنة في جملة واحدة
في البداية كان الذكاء الاصطناعي يتعلم قواعد البشر؛ ثم تعلّم الرؤية البشرية؛ ثم تعلّم اللغة البشرية؛ والآن بدأ يتعلم الاستدلال البشري؛ أما المرحلة التالية، فالذي يحتاج أن يتعلمه حقًا هو العالم الذي يعيش فيه البشر.
LLM → Reasoning → Multimodal → Agent → Computer Use → General Intelligence
بل هو:
عالِمة كرّست أكثر من 20 عامًا لجعل الآلة ترى، وتبدأ الآن بنقل الهدف من “الرؤية” إلى “فهم الفضاء، فهم العالم، فهم الواقع”.
ومن Google Genie 3 وGemini Robotics إلى Meta V-JEPA 2، ثم NVIDIA Cosmos وWorld Labs Atlas، يمكننا رؤية اتجاه صناعي واضح جدًا:
ساحة الذكاء الاصطناعي تتمدّد من “المعلومات الرقمية” إلى “العالم الحقيقي”.
قد يكون هذا هو محور التركيز الأهم للذكاء الاصطناعي في السنوات القليلة القادمة.
النماذج الكبيرة تحل سؤال: “هل يعرف الذكاء الاصطناعي كيف يتكلم؟”؛ والوكيل يحل سؤال: “هل يعرف الذكاء الاصطناعي كيف يفعل؟”؛ أما نموذج العالم فيحل سؤالًا ربما يكون الأهم: “هل يفهم الذكاء الاصطناعي هذا العالم فعلًا؟”
