lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

Jevに敷居はあるのか?OpenJEVはすでに4つの派閥に分かれている:言葉を漏らさないのは簡単だが、確率が信頼できるのは難しい

動察 Beating AI 速報、Jev が公開されてからまだ一週間も経たないうちに、オープンソースコミュニティはすでにこの「答えを書かず、直接確率を出す」モデルの複製を始めている。


それらは皆、同じことを実現しようとしている:トークンごとの生成を省き、選択肢と確率を直接出すことだ。しかし、具体的な方法はすでにいくつかの全く異なる路線に分かれている。


1. SemIf は最もシンプルで、モデルの再トレーニングすら不要だ。既成の Qwen をそのまま使い、モデルが A、B、C に答えようとする時点で遮り、それ以上書き続けさせず、各選択肢のスコアを直接読み取り、それを確率に変換する。


2. Simple Jev も既成の大規模モデルを使うが、さらに重複計算を省く。同じ材料を一度だけ読み、後続の複数の問題がこの部分の結果を共有し、それぞれ答えを判断する。著者も明確に述べており、これは Jev の使用方法を複製したものであり、精度、速度、確率校正のいずれも等価には達していない。


3. Laya は文字を生成する大規模モデルを使わず、より従来の分類器に近いエンコーダモデルに切り替えた。利点は小さくて速いことで、短所も明らかだ。一度に 77 の選択肢から選ぶ場合、Laya の精度はわずか 42.5% で、Jev は 87.0% だ。


4. Von も専用意思決定モデルの路線を取っている。パラメータは約 4 億のみで、文字を生成せず、一度のフォワードパスで Choice、Noul、Score を直接完了し、自然言語を読める次世代分類器のようなものだ。


5. Verdict はさらに小さく、パラメータは約 1.5 億のみ。著者は二つの問題に重点的に取り組んだ:間違えたのに高い信頼度を報告すること、そして選択肢の順序を変えると結果も変わってしまうことだ。確率と判断の両方を安定させることにより関心を置いている。


6. Kev は大規模モデルを保持することを選んだ。Qwen をベースにし、さらに専用の意思決定構造を加え、同じ入力を一度だけ読み、複数の問題がそれぞれ確率を計算する。第三者が以前 Jev をリバースエンジニアリングした際も、同様の設計が使われている可能性を推測していた。


Kev の自己テストでは、訓練時に見たことのない新しい問題でテストし、8B 版の精度は約 78%、Jev は約 86% だった。より明らかな差は信頼度にあり、Kev には間違えた問題でも 90% 以上の確信を示すものがある。


7. Nimble は訓練に重点を置いている。Qwen3.5-9B を使い、さらに「一つの事実だけを変えると正解が反転する」データを用意して事後訓練を行う。訓練に参加していない 324 のテストサンプルで、Nimble は 90.1% が参考解答を選び、Jev は 93.2% だった。ただし著者も注意を促しており、現時点ではモデルが「90% と報告すれば本当に 90% 正しい」とは保証できない。


8. OpenJev が最も遠くまで進み、直接 DiffusionGemma に切り替えた。まずいくつかの回答位置を空けておき、拡散モデルが画像を補完するように一度に埋める。RTX PRO 6000 では、単一リクエストの中央値レイテンシは約94msである。


数日で、OpenJEV はすでに四つの路線に分かれた:既成モデルの回答スコアを直接読み取る、専用の意思決定モデルを訓練する、大規模モデルを意思決定モデルに改造する、そして拡散モデルで直接回答を埋める。


Jev のこの路線は真似しやすそうに見える。本当に差がつくのはやはり精度、汎化、確率校准である。モデルが90%と報告するとして、その90%がどれほど信頼できるかが、最も難しい部分だ。

举报 訂正/通報
訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了