Publication du modèle « Doubao » 2.1 Pro : mise à jour de la version 0915. L’API est désormais déployée intégralement sur Volcano Ark. Cette mise à niveau se concentre sur quatre axes : livraison de tâches via des agents, génération de code multi-modal, compréhension multi-modale et réduction des coûts d’inférence.

Améliorations côté agents

Dans les scénarios nécessitant plusieurs appels d’outils, la recherche d’informations en ligne puis la rédaction d’un rapport, le modèle renforce les capacités de traçabilité des preuves et de vérification des données, réduisant nettement les hallucinations. L’exemple officiel donné concerne la recherche financière et l’investissement : le modèle peut décomposer de manière autonome les besoins d’étude, rechercher des sources de données, puis construire et analyser un modèle. La version de travail produite est proche du niveau d’un analyste. Pour vérifier une affirmation contenue dans un rapport financier d’un constructeur automobile, le modèle a orchestré plus de 500 sous-agents, consulté plus de 1 000 pages web et recoupé des informations provenant de sources multiples, comme les traces maritimes et des images satellites. Ces capacités de « ne pas se fier à un seul communiqué, mais procéder à des validations croisées multi-sources » apportent une valeur directe aux entreprises pour la due diligence et la production de rapports d’étude.

Codage multi-modal

La transformation la plus pratique concerne probablement la génération de code à partir d’images. Le modèle peut désormais lire directement des maquettes de conception, des plans, voire des captures d’écran enregistrant des opérations, puis convertir l’information visuelle en code front-end. La démonstration officielle montre un scénario : fournir au modèle une courte vidéo d’exécution et quelques esquisses, afin qu’il développe une page mobile pour un ancien système ERP sans documentation. Le modèle a compris 280 000 lignes de code Java et a restitué directement une page mobile exécutable.

En matière de compréhension de dépôts de code, le modèle a effectué des tests de correction autonomes sur Luanti (environ 387 000 lignes de code), un jeu open source, et 83 % des tâches ont atteint le niveau requis pour fusionner le code. Ce chiffre mérite l’attention des développeurs qui doivent souvent localiser des problèmes dans de grands projets et corriger des bugs impliquant plusieurs fichiers.

Autres améliorations

Côté compréhension multi-modale, la capacité de raisonnement sur la vidéo a été renforcée : le modèle peut y localiser des preuves et intégrer des informations entre des images (frames). La compréhension d’images s’améliore nettement dans la reconnaissance d’objets 3D (pièces CAD, éléments de moteur de jeu) et l’analyse de visuels denses (plans d’ingénierie, tableaux de rapports financiers).

Côté coûts, la consommation de Tokens pour l’inférence des images et des vidéos a diminué de plus de 30 % par rapport à la génération précédente.

Pour l’utilisation de l’API, il y a deux entrées : appeler Doubao-Seed-2.1-pro-0915 permet de verrouiller la version ; appeler Doubao-Seed-Evolving suit automatiquement la dernière version, sans besoin de changer l’ID de modèle. Les outils de travail Doubao et TRAE ont également été intégrés.

Article officiel : https://mp.weixin.qq.com/s/Fp_mgF6wxMk0bkUVBqOKqA