動察 Beating AI 速報、DeepSeek が V4-Flash-Vision-Exp の初回 Agent ベンチマークを公開。4 つのマルチモーダル Agent 評価では、Opus 4.8 と 2 勝 2 敗の互角:Agents' Last Exam は 27.3 対 25.7、ZeroBench は 35.0 対 34.0;ApexBench は 36.5 対 39.4、Chartography は 64.3 対 65.0。
純テキスト版 V4-Flash-0731 と比較すると、ビジョン版は ApexBench で 26.2 から 36.5 へ、Agents' Last Exam で 25.2 から 27.3 へ上昇。ただし、これらの評価自体に画像が含まれており、公式は V4-Flash がその中のマルチモーダルコンテンツを直接無視すると注記しているため、ここで主に示されるのは視覚入力を補完した後の能力であり、純テキスト推論が突然強化されたわけではない。
視覚を追加しても、テキスト Agent 能力は明らかに低下していない。7 つのテキスト評価では、Vision Exp は 6 項目で V4-Flash-0731 を上回る。例えば DeepSWE は 54.4 から 59.3 へ上昇し、Opus 4.8 の 58.0 をも超える;Toolathlon は 75.9 で、Opus 4.8 の 76.2 にほぼ追いついている。
注意すべき点として、この結果は DeepSeek 公式の自己測定によるもので、第三者による独立したランキングではない。DeepSeek シリーズは公開 Code Agent テキストタスクで DeepSeek Harness の最小モードを使用し、推論レベルは max に設定されている。