يمكن للذكاء الاصطناعي الذي يبدأ بالرد بسرعة أن يستغرق مع ذلك وقتًا طويلًا لإنجاز المهمة.
في مقالها الصادر في 18 سبتمبر، تميّز io.net بين زمن الوصول إلى أول رمز—أي فترة الانتظار قبل بدء الإخراج—وبين الإنتاجية على دفعات. وهي تحيط وحدات GPUs الموزعة الخاصة بها بالتكلفة والمرونة، لا بالفوز بسباق أول رمز.
اختباري لقصة $IO compute: قياس المهمة كاملة. يحتاج مساعد صوتي حيّ إلى استجابة سريعة؛ وتحتاج مهمة مستند تُنفَّذ طوال الليل إلى نتائج دقيقة بحلول موعدها النهائي بتكلفة إجمالية معقولة. أمثلة التكاليف الواردة في المقال توضيحية، وليست مقاييس مستقلة. لا تزال الأحمال الفعلية بحاجة إلى اختبار.
ما الذي يزعجك أكثر: الانتظار حتى الكلمة الأولى، أم الانتظار حتى يكتمل الجواب؟ #AIInference
في مقالها الصادر في 18 سبتمبر، تميّز io.net بين زمن الوصول إلى أول رمز—أي فترة الانتظار قبل بدء الإخراج—وبين الإنتاجية على دفعات. وهي تحيط وحدات GPUs الموزعة الخاصة بها بالتكلفة والمرونة، لا بالفوز بسباق أول رمز.
اختباري لقصة $IO compute: قياس المهمة كاملة. يحتاج مساعد صوتي حيّ إلى استجابة سريعة؛ وتحتاج مهمة مستند تُنفَّذ طوال الليل إلى نتائج دقيقة بحلول موعدها النهائي بتكلفة إجمالية معقولة. أمثلة التكاليف الواردة في المقال توضيحية، وليست مقاييس مستقلة. لا تزال الأحمال الفعلية بحاجة إلى اختبار.
ما الذي يزعجك أكثر: الانتظار حتى الكلمة الأولى، أم الانتظار حتى يكتمل الجواب؟ #AIInference
