動察 Beating AI 速報、独立評価プロジェクト Assistant Benchmark が実際のタスクで個人 AI アシスタントを横断評価し始めた。Agent にホテルの予約、レストランの選択、買い物、メール返信、サードパーティサービスへの接続を直接行わせ、実際の完了状況に基づいて採点する。各評価軸には公開された固定タスクがあり、実際の実行記録がなければ得点できない。
現在、Muse は完了済みの 7 つの評価軸で平均 9.1 点を獲得し、暫定 1 位。Instinct は 11 の評価軸を完了し平均 8.4 点、Grok Bot は 7 つの評価軸を完了し平均 7.3 点。Muse は買い物、メール、サードパーティアプリ接続でいずれも 10 点を獲得している。
ただし、これは継続的に更新される実際の体験ランキングと見なすべきだ。Muse の 9.1 はあくまでテスト済み 7 評価軸の平均点であり、完全な成績ではない。各評価軸も現在は 1 つの固定タスクでしかテストされておらず、今後の追加テストでスコアや順位は変わる可能性がある。