lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

大規模モデルが自ら「下書き」を始める:NCPは後続予測をモデル内部に組み込む

動察 Beating AI 速報、上海AI Labと上海交通大学が89億パラメータのモデルNCP-ArchPreviewを発表。通常の大規模モデルは主に「次のトークンを予測する」ことを訓練するが、NCPはさらに後続の一小段に対応する内部概念信号も予測し、それを用いてトークン生成を補助する。最終的には依然としてトークン単位で出力するが、モデル内部ではすでに先に後続を推測している。


この信号は投機的デコーディングの高速化にも利用できる。DFlashやDSparkといった手法では、小規模モデルにまず後続を推測させ、それを大規模モデルがまとめて検証する。NCPチームは内部概念信号もこの小規模モデルに渡し、いわば「この後は大体どう書くか」というヒントを先に与えてから、一度に16個のトークンを並列で推測させる。


これにより、小規模モデルが的中させる内容が増える。4つのテストで、大規模モデルが1回検証するごとに平均で通過できるトークンが5.933個から6.180個に増え、4.17%の向上;HumanEvalでは7.59%の向上。この信号の導入でドラフトモデルに追加されるパラメータは約4万のみ。


同じ89億パラメータで、NCPは通常のTransformerの約85%の訓練計算量で、訓練誤差をほぼ同水準まで下げられる。

訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了