動察 Beating AI 速報、Artificial Analysis が Gemini 4 Argon の第三者評価を完了。最高推論ティアにおいて、Argon の Intelligence Index は 53 点を獲得し、GPT-6 Astra と並び、GPT-6.1 Sol より 1 点高い。Google の前回の非 Flash モデル Gemini 3.1 Pro Preview と比較して、スコアは 23 点上昇した。
現在の API 初回半額キャンペーンで計算すると、Argon は Intelligence Index タスクあたり平均 1.99 ドルで、GPT-6 Astra の約 60% に過ぎない。しかし生成量が少ないわけではなく、タスクあたり平均約 6.2 万トークンを出力し、Astra はわずか 2.7 万トークンである。キャンペーン終了後、Argon のタスクあたりコストは 3.98 ドルに上昇すると予想され、逆に Astra の約 1.2 倍となる。
Argon の際立った変化の一つは、推測が少なくなったことである。AA-Omniscience において、そのハルシネーション率はわずか 15% で、Intelligence Index スコア 45 以上のモデルの中で最も低い。GPT-6 Astra と GPT-6.1 Sol はそれぞれ 51% と 54% である。ただし Argon の回答正確率は 50% にとどまり、Astra の 63% を下回っている。