أكثر من ستة عشر مليار طلب للذكاء الاصطناعي تم تنظيمها في مجموعة بيانات عامة.

تعاونت منصة الاستدلال اللامركزية Chutes مع باحثين من جامعة هارفارد للكشف عن مجموعة بيانات ميتاداتا لخدمة نماذج لغوية كبيرة، ويُعتقد أنها من أكبر مجموعات ميتاداتا من نوعها على مستوى الحجم. تغطي البيانات سنة كاملة من 11 أبريل 2025 إلى 12 أبريل 2026، وتشمل 6 مليارات و22 مليونًا و241 ألفًا و756 مرة طلب، و9 آلاف و174 نموذجًا، و310 آلاف و4909 و670 مستخدمًا مجهول الهوية. ويمكن تنزيلها من خلال منصة استضافة الأكواد والتخزين التابع للجهة العلمية.

المعلن هو بيانات ميتاداتا، وليس محتوى المحادثات. تتضمن وقتًا وعدد الرموز (Tokens) وزمن الاستجابة والتوقيت الخاص بالاستجابة الأولى. لا توجد تلميحات أو نصائح (Prompts)، ولا توجد إجابات. إن هذا الأسلوب الذي يضع ميتاداتا فقط يمثل بحد ذاته مفاضلة بين الخصوصية وقابلية البحث.

في تدفق حركة المرور خلال هذه السنة، بلغت الرموز المُدخلة نحو 35.8 تريليونًا، بينما بلغت الرموز المُخرجة نحو 2.52 تريليون. ومن الاستنتاج الذي قدمه الباحثون، فإن حوالي 99% من الطلبات تتكرر ضمن 15 دقيقة. وهذه الأرقام للمرة الأولى تمكّن الأطراف الخارجية من تقدير البنية التكلفةية لخدمات الاستدلال اعتمادًا على تدفق حقيقي للبيانات.

إن لهذه النسبة أثرًا مباشرًا على البنية التحتية. وبما أن عددًا كبيرًا من الطلبات يتكرر خلال وقت قصير، فهناك مساحة كبيرة لتحسين عمليات التخزين المؤقت (Cache) والتوزيع (Scheduling)، بدل الاكتفاء برصّ قدرات حوسبة باستمرار. قد تكون قيمة معدل التكرار أعلى من مجرد حجم المعلمات (Parameters).

غالبًا ما تكون أغلى المشاكل هي تلك التي يتم سؤالها مرارًا وتكرارًا.

#人工智能 #بيانات