動察 Beatingのモニタリングによると、AIモデル評価会社のVals AIは4000万ドルのシリーズAラウンドを完了し、評価額は4億ドルに達した。リード投資家はa16zで、8VC、Pear VC、Bloomberg Betaなどの既存株主も引き続き参加した。
Valsが手がけるのは大規模モデルの第三者評価だ。現在、多くのモデルが発表される際、成績は依然としてメーカー自身が測定・報告している。Valsはプログラミング、金融、法律、医療などの実タスクを用いて、異なるモデルを統一テストする。公式によると、その結果はOpenAI、Anthropic、Google、Meta、xAIのモデルカードに引用されており、今年の収益はすでに2025年通年の8倍に達している。
a16zが注目したのは、この「第三者審判」としての価値だ。公開ベンチマークはますますスコア稼ぎが容易になり、トレーニングデータに混入したり、メーカーによるターゲット最適化の対象になったりしやすく、ランキングの高得点が必ずしも実際の使いやすさを意味するわけではない。
今回、ValsはVals Smithも全面的に開放し、任意のGitHubリポジトリを直接Coding Benchmarkに変換できるようにした。システムは過去のPRから実際の開発タスクを抽出し、隠しテストでモデルがタスクを完了できるかをチェックする。これにより、企業は公開ランキングだけを見るのではなく、自社のコードベースに最適なモデルを直接テストできるようになる。