lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

GPT-2からKimi K3へ:大規模モデル7年間のアーキテクチャ進化、その本質は記憶を巡る争奪戦だ

動察 Beatingのモニタリングによると、BasetenのエンジニアAliが長文を発表し、GPT-2からKimi K3に至るまでを詳細に解説した。パラメータ数で計算すると、1つのK3は約22,580個のGPT-2に相当する。しかし彼は、過去7年間の真の変化は単なるモデルの大規模化ではなく、モデルが情報を保存・更新・呼び出す方法を絶えず改良してきたことにあると述べている。

GPT-2はフルアテンションを採用している。各トークンは自身のKeyとValueを残し、後からいつでも参照できる。情報保存は最も完全だが、コンテキストが長くなるほどKV Cacheと計算コストが増大する。

線形アテンションは、履歴全体を固定サイズの状態に圧縮する。コストはコンテキストの増加に伴って膨張しなくなるが、代償として異なる情報が同じ空間に押し込まれる。内容が増えるにつれ、古い記憶が互いに干渉し始める。

その後の複数のアーキテクチャ革新は、この限られた記憶に管理ルールを追加するものだった。DeltaNetはモデルがまず古い内容を読み取り、新旧の差分で上書きすることを可能にする。Gated DeltaNetは全体的な忘却を導入し、古い情報が状況の変化に応じて減衰できるようにした。

KDAはさらに忘却制御を各チャネルに細分化する。異なる情報は異なる保存期間を持つことができる:長期的な事実はより長く保持され、一時的な指示やローカル変数はより速く減衰する。Aliは、これこそがKimi Linearの最も重要な進歩だと述べている。

しかし、固定状態ではすべての詳細を保持することは不可能だ。そのためK3はKDAのみを使用せず、23グループの4層構造を「3層のKDAと1層のMLA」として配置し、最後にもう1層のMLAを追加している。KDAは低コストで長期記憶を維持し、MLAは定期的に完全なコンテキストを参照して、数字、コード、初期の指示などの正確な情報を呼び出す。

K3はまた、Attention Residualsを導入している。通常のモデルは各層の結果を絶えず加算していくため、初期に抽出された情報が93層の計算中に後続の結果によって薄まりやすい。K3はネットワークを12層ごとにブロック化し、後の層が必要に応じて初期段階で形成された中間表現を呼び出せるようにし、毎回原文から再導出する必要をなくした。

したがって、K3の鍵は特定の突然現れたブラックテクノロジーではない。その真に特別な点は、循環記憶、グローバル検索、層間参照、エキスパートルーティングを組み合わせて、階層的な情報システムを構成したことにある。

過去7年間のモデルアーキテクチャの進化は、本質的にモデルに何を残す価値があり、何を上書きすべきか、いつ原文に戻らなければならないかを教えることだった。

訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了