動察 Beating AI 速報、Jev が公開されてからまだ一週間も経たないうちに、オープンソースコミュニティはすでにこの「答えを書かず、直接確率を出す」モデルの複製を始めている。
それらは皆、同じことを実現しようとしている:トークンごとの生成を省き、選択肢と確率を直接出すことだ。しかし、具体的な方法はすでにいくつかの全く異なる路線に分かれている。
1. SemIf は最もシンプルで、モデルの再トレーニングすら不要だ。既成の Qwen をそのまま使い、モデルが A、B、C に答えようとする時点で遮り、それ以上書き続けさせず、各選択肢のスコアを直接読み取り、それを確率に変換する。
2. Simple Jev も既成の大規模モデルを使うが、さらに重複計算を省く。同じ材料を一度だけ読み、後続の複数の問題がこの部分の結果を共有し、それぞれ答えを判断する。著者も明確に述べており、これは Jev の使用方法を複製したものであり、精度、速度、確率校正のいずれも等価には達していない。
3. Laya は文字を生成する大規模モデルを使わず、より従来の分類器に近いエンコーダモデルに切り替えた。利点は小さくて速いことで、短所も明らかだ。一度に 77 の選択肢から選ぶ場合、Laya の精度はわずか 42.5% で、Jev は 87.0% だ。
4. Von も専用意思決定モデルの路線を取っている。パラメータは約 4 億のみで、文字を生成せず、一度のフォワードパスで Choice、Noul、Score を直接完了し、自然言語を読める次世代分類器のようなものだ。
5. Verdict はさらに小さく、パラメータは約 1.5 億のみ。著者は二つの問題に重点的に取り組んだ:間違えたのに高い信頼度を報告すること、そして選択肢の順序を変えると結果も変わってしまうことだ。確率と判断の両方を安定させることにより関心を置いている。
6. Kev は大規模モデルを保持することを選んだ。Qwen をベースにし、さらに専用の意思決定構造を加え、同じ入力を一度だけ読み、複数の問題がそれぞれ確率を計算する。第三者が以前 Jev をリバースエンジニアリングした際も、同様の設計が使われている可能性を推測していた。
Kev の自己テストでは、訓練時に見たことのない新しい問題でテストし、8B 版の精度は約 78%、Jev は約 86% だった。より明らかな差は信頼度にあり、Kev には間違えた問題でも 90% 以上の確信を示すものがある。
7. Nimble は訓練に重点を置いている。Qwen3.5-9B を使い、さらに「一つの事実だけを変えると正解が反転する」データを用意して事後訓練を行う。訓練に参加していない 324 のテストサンプルで、Nimble は 90.1% が参考解答を選び、Jev は 93.2% だった。ただし著者も注意を促しており、現時点ではモデルが「90% と報告すれば本当に 90% 正しい」とは保証できない。
8. OpenJev が最も遠くまで進み、直接 DiffusionGemma に切り替えた。まずいくつかの回答位置を空けておき、拡散モデルが画像を補完するように一度に埋める。RTX PRO 6000 では、単一リクエストの中央値レイテンシは約94msである。
数日で、OpenJEV はすでに四つの路線に分かれた:既成モデルの回答スコアを直接読み取る、専用の意思決定モデルを訓練する、大規模モデルを意思決定モデルに改造する、そして拡散モデルで直接回答を埋める。
Jev のこの路線は真似しやすそうに見える。本当に差がつくのはやはり精度、汎化、確率校准である。モデルが90%と報告するとして、その90%がどれほど信頼できるかが、最も難しい部分だ。