Pembaruan versi 0915 untuk Rilis Model Besar Doubao 2.1 Pro, API kini telah tersedia penuh di VolcEngine Ark. Kali ini peningkatannya terfokus pada empat arah: pengantaran tugas Agent, penulisan kode multimodal, pemahaman multimodal, serta biaya inferensi.
Peningkatan pada Agent
Pada skenario yang membutuhkan pemanggilan alat multi-putaran, penelusuran materi via internet lalu menyusun laporan, model ini memperkuat kemampuan pelacakan bukti dan verifikasi data, sehingga halusinasi berkurang secara nyata. Contoh yang diberikan pihak resmi adalah riset investasi dan perbankan: model mampu menguraikan kebutuhan riset secara mandiri, mengambil sumber data untuk membangun analisis dan pemodelan ulang; naskah awal yang dihasilkan mendekati level analis. Untuk memverifikasi pernyataan dalam laporan keuangan sebuah perusahaan otomotif, model mengoordinasikan lebih dari 500 sub-Agent, menelusuri lebih dari 1000 halaman web, serta melakukan perbandingan silang atas informasi multi-sumber seperti lintasan maritim dan citra satelit. Kemampuan seperti "tidak menerima begitu saja rilis sepihak, verifikasi silang dari berbagai sumber" ini memiliki nilai langsung bagi perusahaan dalam due diligence dan penyusunan laporan riset.
Coding Multimodal
Perubahan yang paling praktis kali ini mungkin adalah kemampuan menulis kode dari gambar. Model sekarang dapat langsung memahami rancangan desain, gambar teknik, bahkan rekaman layar operasi, lalu mengubah informasi visual menjadi kode front-end. Demo resmi memperlihatkan sebuah skenario: berikan model sebuah rekaman layar ditambah beberapa sketsa—lalu model mengembangkan halaman mobile untuk sistem ERP lama yang tidak memiliki dokumentasi. Model mampu membaca 280.000 baris kode Java dan langsung mengembalikan halaman mobile yang bisa dijalankan.
Dalam pemahaman repositori kode, model juga melakukan pengujian perbaikan mandiri pada game open-source Luanti (sekitar 387.000 baris kode); 83% tugas mencapai standar yang dapat digabung (merge). Angka ini layak diperhatikan oleh developer yang sering harus melokalisasi masalah dalam proyek besar dan men-debug lintas file.
Peningkatan lainnya
Pada pemahaman multimodal, kemampuan inferensi video meningkat—dapat menemukan bukti di dalam video dan mengintegrasikan informasi lintas frame; pemahaman gambar juga meningkat secara jelas pada pengenalan objek 3D (komponen CAD, elemen mesin game) serta parsing teks-gambar yang padat (gambar teknik, tabel laporan keuangan).
Dari sisi biaya, konsumsi Token untuk inferensi gambar dan video berkurang lebih dari 30% dibanding generasi sebelumnya.
Dalam penggunaan API, ada dua pintu masuk: memanggil Doubao-Seed-2.1-pro-0915 untuk mengunci versi; memanggil Doubao-Seed-Evolving akan otomatis mengikuti versi terbaru tanpa perlu mengganti Model ID. Pekerjaan Doubao dan TRAE juga telah disinkronkan untuk terhubung.
Artikel resmi: https://mp.weixin.qq.com/s/Fp_mgF6wxMk0bkUVBqOKqA
Peningkatan pada Agent
Pada skenario yang membutuhkan pemanggilan alat multi-putaran, penelusuran materi via internet lalu menyusun laporan, model ini memperkuat kemampuan pelacakan bukti dan verifikasi data, sehingga halusinasi berkurang secara nyata. Contoh yang diberikan pihak resmi adalah riset investasi dan perbankan: model mampu menguraikan kebutuhan riset secara mandiri, mengambil sumber data untuk membangun analisis dan pemodelan ulang; naskah awal yang dihasilkan mendekati level analis. Untuk memverifikasi pernyataan dalam laporan keuangan sebuah perusahaan otomotif, model mengoordinasikan lebih dari 500 sub-Agent, menelusuri lebih dari 1000 halaman web, serta melakukan perbandingan silang atas informasi multi-sumber seperti lintasan maritim dan citra satelit. Kemampuan seperti "tidak menerima begitu saja rilis sepihak, verifikasi silang dari berbagai sumber" ini memiliki nilai langsung bagi perusahaan dalam due diligence dan penyusunan laporan riset.
Coding Multimodal
Perubahan yang paling praktis kali ini mungkin adalah kemampuan menulis kode dari gambar. Model sekarang dapat langsung memahami rancangan desain, gambar teknik, bahkan rekaman layar operasi, lalu mengubah informasi visual menjadi kode front-end. Demo resmi memperlihatkan sebuah skenario: berikan model sebuah rekaman layar ditambah beberapa sketsa—lalu model mengembangkan halaman mobile untuk sistem ERP lama yang tidak memiliki dokumentasi. Model mampu membaca 280.000 baris kode Java dan langsung mengembalikan halaman mobile yang bisa dijalankan.
Dalam pemahaman repositori kode, model juga melakukan pengujian perbaikan mandiri pada game open-source Luanti (sekitar 387.000 baris kode); 83% tugas mencapai standar yang dapat digabung (merge). Angka ini layak diperhatikan oleh developer yang sering harus melokalisasi masalah dalam proyek besar dan men-debug lintas file.
Peningkatan lainnya
Pada pemahaman multimodal, kemampuan inferensi video meningkat—dapat menemukan bukti di dalam video dan mengintegrasikan informasi lintas frame; pemahaman gambar juga meningkat secara jelas pada pengenalan objek 3D (komponen CAD, elemen mesin game) serta parsing teks-gambar yang padat (gambar teknik, tabel laporan keuangan).
Dari sisi biaya, konsumsi Token untuk inferensi gambar dan video berkurang lebih dari 30% dibanding generasi sebelumnya.
Dalam penggunaan API, ada dua pintu masuk: memanggil Doubao-Seed-2.1-pro-0915 untuk mengunci versi; memanggil Doubao-Seed-Evolving akan otomatis mengikuti versi terbaru tanpa perlu mengganti Model ID. Pekerjaan Doubao dan TRAE juga telah disinkronkan untuk terhubung.
Artikel resmi: https://mp.weixin.qq.com/s/Fp_mgF6wxMk0bkUVBqOKqA
