مشروع ذكاء اصطناعي يقول: «الأداء أقوى»، وأهم ما ينبغي الاستفسار عنه هو ما إذا كانت شروط المقارنة متطابقة.

فيما يلي مثال افتراضي للتقييم، وليس مطابقًا للمشروع الحالي. المشروع (أ) يزعم أن معالجة صورة واحدة تستغرق ثانيتين، بينما (ب) يستغرق ثانية واحدة. يحتسب (أ) قراءة الصورة، والانتظار في الطابور، والإخراج الكامل ضمن الزمن، ويتم التشغيل على بطاقة رسومات عادية؛ أما (ب) فيحسب فقط زمن توليد النموذج، باستخدام بطاقة أقوى وطلبات مفردة بعد الإحماء. قد تكون الأرقام صحيحة، لكن لا يمكن كتابة أن أداء (ب) «أقوى» لأن الطرفين لا يقيسان الشيء نفسه.

أما افتراض المقارنة القابلة للمقارنة، فأن تكون المهمة، وعينات الإدخال، والعتاد، ومستوى التوازي، ونقاط بدء القياس ونهايته متطابقة. كما يجب النظر أيضًا إلى جودة المخرجات: قد يكون الأمر أسرع لكن الإجابات خاطئة أكثر؛ ولا معنى بالنظر إلى السرعة وحدها. إذا غابت أي من هذه العناصر، فلا يمكن صياغة الاستنتاج إلا على أنه: «قدّم كلٌ منهما نتيجة لنفسه، ولا يمكن إجراء مقارنة مباشرة في الوقت الحالي».

عند رؤية نتائج تشغيل جديدة، راجع مع الجهة المطورة للتحقق من مجموعة الاختبار نفسها، ونفس منهجية القياس الزمنية، ومؤشرات الجودة. إذا لم يتوفر ذلك، فغيّر عبارة «أقوى» إلى «لم تتم مواءمة الشروط، ويجب التحقق». وإذا كان الطرفان أصلًا ينجزان مهام مختلفة، فلا تكون المقارنة المباشرة من الأساس ممكنة؛ عندها ينبغي أن تسأل ما إذا كان كلاهما يحقق الهدف نفسه.