DeepSeekは、V4-Flash-Vision-Expの最初のエージェントベンチマーク結果を公開し、4つのマルチモーダルなエージェント評価においてOpus 4.8に対して2対2の拮抗(2-2)となったことを示しました。ChainCatcherによると、このモデルはAgents' Last Examで25.7に対して27.3、ZeroBenchで34.0に対して35.0を記録した一方で、Opus 4.8はApexBenchで36.5に対して39.4、Chartographyで64.3に対して65.0とリードしました。

テキストのみのV4-Flash-0731と比べて、視覚版はApexBenchで26.2から36.5へ、Agents' Last Examで25.2から27.3へと向上しました。DeepSeekは、テキストのみの版はマルチモーダルのコンテンツを無視しているため、この向上は主に視覚入力の追加によるものだと述べました。

DeepSeekは、テキストベースのエージェント性能が、ビジョンを追加しても実質的には低下しなかったとも述べました。7つのテキストベンチマークのうち6つがV4-Flash-0731より高く、DeepSWEは54.4から59.3へ上昇し、Opusの4.8が58.0であるのを上回りました。また、Toolathlonは75.9に到達し、Opusの4.8である76.2に近づきました。これらの結果はDeepSeek自身のテストによるものであり、独立した第三者によるランキングではありません。さらに、公開されているCode Agentのテキスト課題では、DeepSeek Harnessを最小モードで使い、最大推論設定を使用しました。