lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

Qwen3.8-Omni-Flashがリリース:自ら動画を視聴し、ツールを操作し、完成品を納品

動察 Beating AI 速報、アリババのQwenがネイティブ全モーダルモデル Qwen3.8-Omni-Flash をリリース、テキスト、画像、音声、動画、および1Mコンテキストをサポート。


この世代は明らかに音声・動画Agent能力を強化している。モデルは自ら動画から情報を見つけ、タスクを計画し、外部ツールを呼び出して編集、吹き替え、レンダリングを完了できる。公式は長時間会議の処理、ショートドラマ翻訳、映画解説、MV制作、動画から图文ノートへの変換などのシーンを披露した。


数時間の長尺動画に対しても、最初から最後まで全部処理する必要はない。モデルはまず答えがどこにあるかを判断し、段階的にキーとなるクリップを特定する。OmniVideoBenchでは、精度が63.4から67.8に向上し、Token消費が145,736から79,117に減少、45.7%削減された。


Qwenによると、Qwen3.8-Omni-Flashは30項目の評価で平均スコアがQwen3.5-Omni-Plusより26%以上向上し、音声・動画能力はGemini 3.8 Flashに近づき、音声能力は全体的に後者を超えている。音声入力コストは98%以上低下し、音声・動画入力は93%以上低下した。


現在、Qwen3.8-Omni-Flashモデルの重みは未公開で、APIのみ開放されている。Qwenは同時にQwen-MM-Pluginsをオープンソース化し、Claude Code、Codex、Gemini CLI、Qwen CodeなどのAgentにインストールして、画像、音声、長尺動画処理、動画編集能力を補完できる。


もう一つのQwen-Live Harnessはよりリアルタイムスケジューリング層に近い。ユーザーはリアルタイム全モーダルモデルと直接話し、複雑なタスクをGemini CLI、Claude Code、CodexなどのバックグラウンドAgentに継続実行させることができる。タスクの進捗を追跡し、完了後に自ら戻って結果を教えてくれる。

訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了