動察 Beating AI 速報、AIラボBanbury RoadがKardashev-0.7をリリース、32の異なるモデルで構成されている。チームは強化学習を用いてこれらのモデルを一緒に訓練し、それぞれの役割を事前に規定せず、訓練の中で異なる専門性と補完的な能力を形成させた。この手法はRL for Population Scaling(RLPS)と呼ばれている。
これまでのRLPS実験では最大16モデルまでだった。8モデル実験では、共同訓練後のモデル群のスコアは81.70%で、8つの独立訓練モデルの71.04%を上回り、同一モデルを8回繰り返しサンプリングした72.65%も上回った。16モデル実験では、22問がそのうち1つのモデルだけが正解し、異なるモデルが確かに異なる能力を学習したことを示している。
Kardashev-0.7は規模を32モデルに拡大した。Banbury Roadによると、0.007~0.02倍の推論コスト、0.03倍のメモリでフロンティアモデル級の性能を達成できるという。現在API Betaはまだウェイトリストへの参加が必要である。
ただし、以前の8および16モデル実験における群スコアは、事後に標準答案を用いて複数のモデル出力から最良の結果を選んだものである。実際の使用時には標準答案がなく、システムがどのように自動で正しい回答を選び出すかについて、Banbury Roadはまだ完全な方案を公開していない。