動察 Beating AI 速報、Nous Research が Hermes Agent にモデルランキング Hermes Index を公開、主に異なるモデルの Hermes 内でのパフォーマンスを比較するために使用される。すべてのモデルは同一の Hermes Agent 実行フレームワークを使用し、推論強度の調整をサポートするものは統一して high に設定される。ランキングは Hermes Bench、Terminal-Bench 4、Terminal-Bench Science、SkillsBench の4項目のテストの平均スコアを採用し、同時にタスクあたりの平均コストも集計する。
其中 Hermes Bench は Nous Research が独自に新たに作成したテストで、合計150のタスク、25種類のシナリオがあり、Skills、研究、チャートと創作、記憶、ツール呼び出し、セキュリティをカバーしている。Agent はワークスペースと実際のファイルを直接処理し、最終的に生成されたファイル、タスクの状態、ツール使用記録に基づいて採点される。
初版では合計14のモデルをテストした。Claude Opus 5.5 が63.31点で1位、GPT 6 Astra が56.25点で2位、Claude Sonnet 5.5 が53.14点で3位。Astra はタスクあたり平均11.61ドルで、全ランキング中最高。Opus 5.5 は4.99ドル、Sonnet 5.5 は2.82ドルで、両者の一部データは依然として公式に暫定とされている。
低価格モデルでは、DeepSeek V4.1 Flash が36.91点を獲得し、タスクあたり平均0.259ドル。GPT 6 Luna は33.89点で、タスクあたり0.141ドル。両者ともコストとパフォーマンスの Pareto フロンティアに入っており、つまりより低価格で同時により高いスコアのモデルは存在しない。