إصدار 0915 من نموذج Doubao الكبير 2.1 Pro، مع توافر الـ API بالكامل على Volcano Ark. تركز هذه الترقية على أربعة محاور: تسليم مهام الـ Agent، والبرمجة متعددة الوسائط، والفهم متعدد الوسائط، وخفض تكاليف الاستدلال.
تحسينات جانب الـ Agent
عند الحاجة إلى استدعاء أدوات متعددة المراحل، والبحث عبر الإنترنت عن معلومات ثم إصدار تقرير، عزز النموذج قدرات تتبع الأدلة والتحقق من البيانات، ما يقلل بشكل واضح من الهلوسة. والمثال الذي قدمته الجهة الرسمية هو الاستثمار المالي والأبحاث: يستطيع النموذج تفكيك احتياجات البحث تلقائيًا، والبحث عن مصادر البيانات ثم بناء نموذج للتحليل، لتكون المسودات الناتجة قريبة من مستوى المحللين. وللتحقق من ادعاء ورد في تقرير مالي لشركة سيارات بعينها، قام النموذج بجدولة أكثر من 500 Agent فرعي، واسترجع أكثر من 1000 صفحة ويب، كما قام بالمقارنة المتقاطعة بين معلومات مثل مسارات الملاحة البحرية وصور الأقمار الصناعية وغيرها من مصادر متعددة. وتتمتع هذه القدرة من نوع "عدم الاعتماد على بيان طرف واحد، والتحقق المتقاطع من مصادر متعددة" بقيمة مباشرة للشركات في إجراء العناية الواجبة وإعداد تقارير بحثية.
الترميز متعدد الوسائط (Coding)
قد تكون أكثر التغييرات عملية هي كتابة الكود اعتمادًا على الصور. يستطيع النموذج الآن قراءة مخططات التصميم وفواتير/رسومات المخططات وحتى تسجيلات التشغيل (screen recordings) بشكل مباشر، وتحويل المعلومات البصرية إلى كود الواجهة الأمامية. وقد عرضت الجهة الرسمية سيناريو: أعطِ النموذج تسجيل شاشة مع بضع رسومات تخطيطية، وسيقوم بتطوير صفحة للواجهة الأمامية على نظام ERP قديم لا يتوفر له توثيق—فهم النموذج 280 ألف سطر من كود Java، وأعاد مباشرة صفحة واجهة تعمل على الهاتف المحمول.
وبالنسبة لفهم مستودعات الكود، أجرى النموذج اختبارات إصلاح ذاتي على لعبة مفتوحة المصدر Luanti (حوالي 387 ألف سطر من الكود)، وحققت 83% من المهام مستوى يمكن دمجه. وبالنسبة للمطورين الذين يحتاجون كثيرًا إلى تحديد المشكلات داخل مشاريع كبيرة وتصحيح الأخطاء عبر ملفات متعددة، فإن هذا الرقم يستحق الاهتمام.
ترقيات أخرى
في جانب الفهم متعدد الوسائط، تم تعزيز قدرات استدلال الفيديو، بحيث يمكنه تحديد الأدلة داخل الفيديو ودمج المعلومات عبر الإطارات (frames). كما شهد فهم الصور تحسينات واضحة في التعرف على الأجسام ثلاثية الأبعاد (قطع CAD وعناصر محرك الألعاب) وتحليل الصور والمواد النصية الكثيفة (رسومات هندسية وجداول تقارير مالية).
من ناحية التكاليف، فإن استهلاك الـ Tokens للاستدلال على الصور والفيديو انخفض بنسبة 30% أو أكثر مقارنةً بالجيل السابق.
بالنسبة لاستخدام الـ API، توجد مدخلان: استدعاء Doubao-Seed-2.1-pro-0915 لقفل الإصدار؛ واستدعاء Doubao-Seed-Evolving لمتابعة أحدث إصدار تلقائيًا دون الحاجة لتغيير Model ID. كما تم إدماج Doubao Work وTRAE أيضًا بشكل متزامن.
المقال الرسمي: https://mp.weixin.qq.com/s/Fp_mgF6wxMk0bkUVBqOKqA
تحسينات جانب الـ Agent
عند الحاجة إلى استدعاء أدوات متعددة المراحل، والبحث عبر الإنترنت عن معلومات ثم إصدار تقرير، عزز النموذج قدرات تتبع الأدلة والتحقق من البيانات، ما يقلل بشكل واضح من الهلوسة. والمثال الذي قدمته الجهة الرسمية هو الاستثمار المالي والأبحاث: يستطيع النموذج تفكيك احتياجات البحث تلقائيًا، والبحث عن مصادر البيانات ثم بناء نموذج للتحليل، لتكون المسودات الناتجة قريبة من مستوى المحللين. وللتحقق من ادعاء ورد في تقرير مالي لشركة سيارات بعينها، قام النموذج بجدولة أكثر من 500 Agent فرعي، واسترجع أكثر من 1000 صفحة ويب، كما قام بالمقارنة المتقاطعة بين معلومات مثل مسارات الملاحة البحرية وصور الأقمار الصناعية وغيرها من مصادر متعددة. وتتمتع هذه القدرة من نوع "عدم الاعتماد على بيان طرف واحد، والتحقق المتقاطع من مصادر متعددة" بقيمة مباشرة للشركات في إجراء العناية الواجبة وإعداد تقارير بحثية.
الترميز متعدد الوسائط (Coding)
قد تكون أكثر التغييرات عملية هي كتابة الكود اعتمادًا على الصور. يستطيع النموذج الآن قراءة مخططات التصميم وفواتير/رسومات المخططات وحتى تسجيلات التشغيل (screen recordings) بشكل مباشر، وتحويل المعلومات البصرية إلى كود الواجهة الأمامية. وقد عرضت الجهة الرسمية سيناريو: أعطِ النموذج تسجيل شاشة مع بضع رسومات تخطيطية، وسيقوم بتطوير صفحة للواجهة الأمامية على نظام ERP قديم لا يتوفر له توثيق—فهم النموذج 280 ألف سطر من كود Java، وأعاد مباشرة صفحة واجهة تعمل على الهاتف المحمول.
وبالنسبة لفهم مستودعات الكود، أجرى النموذج اختبارات إصلاح ذاتي على لعبة مفتوحة المصدر Luanti (حوالي 387 ألف سطر من الكود)، وحققت 83% من المهام مستوى يمكن دمجه. وبالنسبة للمطورين الذين يحتاجون كثيرًا إلى تحديد المشكلات داخل مشاريع كبيرة وتصحيح الأخطاء عبر ملفات متعددة، فإن هذا الرقم يستحق الاهتمام.
ترقيات أخرى
في جانب الفهم متعدد الوسائط، تم تعزيز قدرات استدلال الفيديو، بحيث يمكنه تحديد الأدلة داخل الفيديو ودمج المعلومات عبر الإطارات (frames). كما شهد فهم الصور تحسينات واضحة في التعرف على الأجسام ثلاثية الأبعاد (قطع CAD وعناصر محرك الألعاب) وتحليل الصور والمواد النصية الكثيفة (رسومات هندسية وجداول تقارير مالية).
من ناحية التكاليف، فإن استهلاك الـ Tokens للاستدلال على الصور والفيديو انخفض بنسبة 30% أو أكثر مقارنةً بالجيل السابق.
بالنسبة لاستخدام الـ API، توجد مدخلان: استدعاء Doubao-Seed-2.1-pro-0915 لقفل الإصدار؛ واستدعاء Doubao-Seed-Evolving لمتابعة أحدث إصدار تلقائيًا دون الحاجة لتغيير Model ID. كما تم إدماج Doubao Work وTRAE أيضًا بشكل متزامن.
المقال الرسمي: https://mp.weixin.qq.com/s/Fp_mgF6wxMk0bkUVBqOKqA
