動察 Beating のモニタリングによると、Artificial Analysis は新しい AI 分析能力テスト「AA-AnalystAgent」を発表した。このテストでは、モデルに実際のテーブルやドキュメントを処理させ、データ統計、トレンド分析、財務モデリングなどのタスクを完了させる。テストは全80問で、各問題についてモデルに独立して5回解答させ、5回すべて正解した場合のみ合格とみなされる。
結果、1位は Claude Opus 5 で、それでも連続5回すべて正解できた問題は54%にとどまった。GPT-5.5 は2位で合格率50%、Claude Fable 5 は49%だった。オープンウェイトモデルの中で最も良い成績だったのは Kimi K3 で39%だった。
各回の平均正解率だけを見ると、GPT-5.5 が実は最も高く66%に達する。しかし、同じ問題に連続5回正解することを要求すると、その合格率は50%に落ちる。Claude Opus 5 は単回の正解率はやや低いものの、より安定しているため、最終的に1位となった。
AI の最も一般的な問題は計算ができないことではなく、最初に問題を誤解してしまうことだ。Artificial Analysis は1567件の失敗記録を分析したところ、その57%でこの状況が見られた:モデルが誤った解釈を早々に確定し、その後ずっとその方向で進めてしまう。