BlockBeats ニュース、9月9日、アントグループのオープンソース発表によると、百灵シリーズ初のネイティブマルチモーダル大規模モデル「Ling-3.0-flash-VL」を正式にリリースし、オープンソース化した。このモデルは Ling-3.0-flash の MoE アーキテクチャを基に拡張され、総パラメータ数は 124B、単回推論で 5.5B のパラメータを活性化し、画像・テキスト・動画入力をネイティブにサポートし、コンテキストウィンドウは 256K トークンに達する。
「実際のタスクをより信頼性高く、より効率的に完了する方法」に焦点を当て、Ling-3.0-flash-VL は以下の方向性を重点的に探求している:
大規模モデルに視覚能力を追加する際、一般的な懸念としてテキスト知能が低下する可能性がある。しかし、トレーニング実践は逆の結論を示している:ネイティブなマルチモーダル共同トレーニングはアプリケーションの境界を広げるだけでなく、テキスト知能も向上させる。Ling-3.0-flash-VL は視覚フィードバックメカニズム——実行結果の観察、目標との比較、偏差の発見、継続的な修正——を導入し、タスクを一度きりの「生成」から「観察→行動→検証→修正」のクローズドループに変え、実行結果をより信頼性の高いものにしている。
Ling-3.0-flash-VL は、Ling-3.0-flash が Agent ワークフローにおいて効率的な実行ノードとして持つ中核的な強みを継承し、視覚フィードバックのクローズドループにおいて出力品質と実行効率の両立を図り、より低いコストとより短い時間で完全なタスクを推進する。