lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

DeepSeek視覚モデルのマルチモーダルエージェントがOpus 4.8に迫る!4項目で2:2の引き分け

動察 Beating AI 速報、DeepSeek が V4-Flash-Vision-Exp の初回 Agent ベンチマークを公開。4 つのマルチモーダル Agent 評価では、Opus 4.8 と 2 勝 2 敗の互角:Agents' Last Exam は 27.3 対 25.7、ZeroBench は 35.0 対 34.0;ApexBench は 36.5 対 39.4、Chartography は 64.3 対 65.0。

純テキスト版 V4-Flash-0731 と比較すると、ビジョン版は ApexBench で 26.2 から 36.5 へ、Agents' Last Exam で 25.2 から 27.3 へ上昇。ただし、これらの評価自体に画像が含まれており、公式は V4-Flash がその中のマルチモーダルコンテンツを直接無視すると注記しているため、ここで主に示されるのは視覚入力を補完した後の能力であり、純テキスト推論が突然強化されたわけではない。

視覚を追加しても、テキスト Agent 能力は明らかに低下していない。7 つのテキスト評価では、Vision Exp は 6 項目で V4-Flash-0731 を上回る。例えば DeepSWE は 54.4 から 59.3 へ上昇し、Opus 4.8 の 58.0 をも超える;Toolathlon は 75.9 で、Opus 4.8 の 76.2 にほぼ追いついている。

注意すべき点として、この結果は DeepSeek 公式の自己測定によるもので、第三者による独立したランキングではない。DeepSeek シリーズは公開 Code Agent テキストタスクで DeepSeek Harness の最小モードを使用し、推論レベルは max に設定されている。

訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了