lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

Hermesモデルランキングが公開、Opus 5.5が1位、Astraは2位だが最も高価

動察 Beating AI 速報、Nous Research が Hermes Agent にモデルランキング Hermes Index を公開、主に異なるモデルの Hermes 内でのパフォーマンスを比較するために使用される。すべてのモデルは同一の Hermes Agent 実行フレームワークを使用し、推論強度の調整をサポートするものは統一して high に設定される。ランキングは Hermes Bench、Terminal-Bench 4、Terminal-Bench Science、SkillsBench の4項目のテストの平均スコアを採用し、同時にタスクあたりの平均コストも集計する。


其中 Hermes Bench は Nous Research が独自に新たに作成したテストで、合計150のタスク、25種類のシナリオがあり、Skills、研究、チャートと創作、記憶、ツール呼び出し、セキュリティをカバーしている。Agent はワークスペースと実際のファイルを直接処理し、最終的に生成されたファイル、タスクの状態、ツール使用記録に基づいて採点される。


初版では合計14のモデルをテストした。Claude Opus 5.5 が63.31点で1位、GPT 6 Astra が56.25点で2位、Claude Sonnet 5.5 が53.14点で3位。Astra はタスクあたり平均11.61ドルで、全ランキング中最高。Opus 5.5 は4.99ドル、Sonnet 5.5 は2.82ドルで、両者の一部データは依然として公式に暫定とされている。


低価格モデルでは、DeepSeek V4.1 Flash が36.91点を獲得し、タスクあたり平均0.259ドル。GPT 6 Luna は33.89点で、タスクあたり0.141ドル。両者ともコストとパフォーマンスの Pareto フロンティアに入っており、つまりより低価格で同時により高いスコアのモデルは存在しない。

訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了