#новости ИИ

🤖 أخطأ الذكاء الاصطناعي بنسبة 88% في أسئلة مالية معقدة — دراسة

تحققت شركة Saturn من 18 نموذجًا لـ ChatGPT وClaude وCopilot وGrok وGemini عبر أكثر من 10 000 طلب. في المتوسط، كانت الإجابات غير صحيحة في 57% من الحالات، وفي المهام التي تتضمن عدة حسابات — بنسبة 88%.

كانت روبوتات الدردشة تتلخبط في عمليات الحساب، وتتجاهل تغييرات قواعد الضرائب، وتخترع إجاباتها الخاصة. في أحد الاختبارات، قد تكون خطأ لدى Claude قد كلف مستثمرًا تقاعديًا 17 500£.

التطبيقات المدفوعة أداؤها أفضل من المجانية، لكن حتى أفضل نتيجة في المهام المعقدة — كانت بنسبة 39% من الإجابات الخاطئة.