DeepSeek lanzó los primeros resultados del benchmark de agentes para V4-Flash-Vision-Exp, mostrando un reparto 2-2 frente a Opus 4.8 en cuatro evaluaciones multimodales de agentes. Según ChainCatcher, el modelo obtuvo 27.3 frente a 25.7 en Agents' Last Exam y 35.0 frente a 34.0 en ZeroBench, mientras que Opus 4.8 lideró en ApexBench con 39.4 frente a 36.5 y en Chartography con 65.0 frente a 64.3.
En comparación con el texto-only V4-Flash-0731, la versión con visión mejoró en ApexBench de 26.2 a 36.5 y en Agents' Last Exam de 25.2 a 27.3. DeepSeek dijo que la versión solo de texto ignora el contenido multimodal, por lo que las mejoras reflejan principalmente la adición de entrada visual.
DeepSeek también dijo que el rendimiento de los agentes basados en texto no disminuyó materialmente después de añadir visión. En siete benchmarks de texto, seis fueron más altos que V4-Flash-0731, incluido DeepSWE, que subió de 54.4 a 59.3, por encima de 58.0 de Opus 4.8, y Toolathlon, que alcanzó 75.9, cerca de 76.2 de Opus 4.8. Los resultados provinieron de las propias pruebas de DeepSeek, no de un ranking independiente de terceros, y las tareas públicas de texto para Code Agent usaron DeepSeek Harness en modo mínimo con la configuración de razonamiento máxima.
