lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

微博がオープンソースのVibeThinker-3Bを公開、3Bの小型モデルが最先端の推論層に躍り出た。

動察 Beating のモニタリングによると、新浪微博(Sina Weibo)チームはこのほど、30億パラメータの推論モデル「VibeThinker-3B」をオープンソース化しました。

このモデルは、数学やプログラミングなどのタスクで最先端の性能を達成し、一部の指標ではDeepSeek V3.2、GLM-5、Gemini 3 Proなどの大規模フラッグシップモデルに迫るか、それを上回っています。

VibeThinker-3Bは、Qwen2.5-Coder-3Bをベースに改良され、Spectrum-to-Signalプロセスを用いた二次トレーニングを実施。モデルはまず易しい問題から難しい問題へと段階的に解答し、解答の系統を蓄積。その後、強化学習を通じて正しい解法のシグナルを増幅させ、トレーニング全体では64Kの大規模思考空間を使用し、推論ステップの中断を防止しています。

数学とプログラミングに関して、モデルは一方で自身が正解した優れたステップを収集し、自己蒸留による模倣を実施。他方で、解答時にステップレベルの評価を導入し、自己チェックを行います。この自己チェックメカニズムにより、最終的にAIME26数学テストのスコアが94.3から97.1に向上しました。

研究チームは報告書の中で「パラメータ圧縮・カバレッジ仮説」を提唱。論理的推論は高度に圧縮可能な能力であり、主にルールと誤り訂正に依存するため、3Bの小型モデルでもトップクラスの効果を発揮できるとしています。一方、オープンドメインの知識は膨大なパラメータによる丸暗記が必要です。パラメータ規模の制約により、VibeThinker-3Bの常識的なオープン知識に対するカバレッジ能力は、大規模モデルに劣ります。

チームは、研究開発の目的は小型モデルで大規模モデルを代替することではなく、明確な検証メカニズムの下でのコンパクトモデルの能力限界を探求することにあると強調しています。

訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了