DeepSeek đã công bố kết quả benchmark tác nhân (Agent) đầu tiên cho V4-Flash-Vision-Exp, cho thấy tỷ lệ chia đôi 2-2 so với Opus 4.8 trên bốn đánh giá tác nhân đa phương thức. Theo ChainCatcher, mô hình đạt 27,3 so với 25,7 trên Agents' Last Exam và 35,0 so với 34,0 trên ZeroBench, trong khi Opus 4.8 dẫn đầu trên ApexBench với 39,4 so với 36,5 và trên Chartography với 65,0 so với 64,3.

So với V4-Flash-0731 chỉ văn bản, phiên bản có tầm nhìn đã cải thiện trên ApexBench từ 26,2 lên 36,5 và trên Agents' Last Exam từ 25,2 lên 27,3. DeepSeek cho biết phiên bản chỉ văn bản bỏ qua nội dung đa phương thức, vì vậy các kết quả tăng chủ yếu phản ánh việc bổ sung đầu vào dạng hình ảnh.

DeepSeek cũng cho biết hiệu suất của tác nhân dựa trên văn bản không suy giảm đáng kể sau khi thêm khả năng nhìn (vision). Trong bảy bài kiểm tra văn bản, có sáu bài đạt kết quả cao hơn V4-Flash-0731; bao gồm DeepSWE tăng từ 54,4 lên 59,3, cao hơn Opus (4.8) là 58,0, và Toolathlon đạt 75,9, gần với Opus 4.8 là 76,2. Kết quả được đưa ra từ quá trình thử nghiệm của chính DeepSeek, không phải bảng xếp hạng độc lập từ bên thứ ba. Ngoài ra, các tác vụ văn bản của Code Agent công khai sử dụng DeepSeek Harness ở chế độ tối thiểu với mức thiết lập suy luận tối đa.