動察 Beating AI 速報、アリババのQwenがネイティブ全モーダルモデル Qwen3.8-Omni-Flash をリリース、テキスト、画像、音声、動画、および1Mコンテキストをサポート。
この世代は明らかに音声・動画Agent能力を強化している。モデルは自ら動画から情報を見つけ、タスクを計画し、外部ツールを呼び出して編集、吹き替え、レンダリングを完了できる。公式は長時間会議の処理、ショートドラマ翻訳、映画解説、MV制作、動画から图文ノートへの変換などのシーンを披露した。
数時間の長尺動画に対しても、最初から最後まで全部処理する必要はない。モデルはまず答えがどこにあるかを判断し、段階的にキーとなるクリップを特定する。OmniVideoBenchでは、精度が63.4から67.8に向上し、Token消費が145,736から79,117に減少、45.7%削減された。
Qwenによると、Qwen3.8-Omni-Flashは30項目の評価で平均スコアがQwen3.5-Omni-Plusより26%以上向上し、音声・動画能力はGemini 3.8 Flashに近づき、音声能力は全体的に後者を超えている。音声入力コストは98%以上低下し、音声・動画入力は93%以上低下した。
現在、Qwen3.8-Omni-Flashモデルの重みは未公開で、APIのみ開放されている。Qwenは同時にQwen-MM-Pluginsをオープンソース化し、Claude Code、Codex、Gemini CLI、Qwen CodeなどのAgentにインストールして、画像、音声、長尺動画処理、動画編集能力を補完できる。
もう一つのQwen-Live Harnessはよりリアルタイムスケジューリング層に近い。ユーザーはリアルタイム全モーダルモデルと直接話し、複雑なタスクをGemini CLI、Claude Code、CodexなどのバックグラウンドAgentに継続実行させることができる。タスクの進捗を追跡し、完了後に自ら戻って結果を教えてくれる。