lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

蚂蚁集团は、マルチモーダル大規模言語モデル「Ling-3.0-flash-VL」をオープンソース化すると発表しました。

BlockBeats ニュース、9月9日、アントグループのオープンソース発表によると、百灵シリーズ初のネイティブマルチモーダル大規模モデル「Ling-3.0-flash-VL」を正式にリリースし、オープンソース化した。このモデルは Ling-3.0-flash の MoE アーキテクチャを基に拡張され、総パラメータ数は 124B、単回推論で 5.5B のパラメータを活性化し、画像・テキスト・動画入力をネイティブにサポートし、コンテキストウィンドウは 256K トークンに達する。


「実際のタスクをより信頼性高く、より効率的に完了する方法」に焦点を当て、Ling-3.0-flash-VL は以下の方向性を重点的に探求している:


大規模モデルに視覚能力を追加する際、一般的な懸念としてテキスト知能が低下する可能性がある。しかし、トレーニング実践は逆の結論を示している:ネイティブなマルチモーダル共同トレーニングはアプリケーションの境界を広げるだけでなく、テキスト知能も向上させる。Ling-3.0-flash-VL は視覚フィードバックメカニズム——実行結果の観察、目標との比較、偏差の発見、継続的な修正——を導入し、タスクを一度きりの「生成」から「観察→行動→検証→修正」のクローズドループに変え、実行結果をより信頼性の高いものにしている。


Ling-3.0-flash-VL は、Ling-3.0-flash が Agent ワークフローにおいて効率的な実行ノードとして持つ中核的な強みを継承し、視覚フィードバックのクローズドループにおいて出力品質と実行効率の両立を図り、より低いコストとより短い時間で完全なタスクを推進する。

举报 訂正/通報
訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了