lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

Haiku 5.5の独立評価は43点:GPT-6 Lunaを大きくリードするが、最高グレードのトークン消費は3倍以上

動察 Beating AI 速報、第三者評価機関 Artificial Analysis が Claude Haiku 5.5 のテスト結果を公表した。新モデルは総合知能指数で 43 点を獲得し、前世代の 17 点から 26 点向上した。GPT-6 Luna の 38 点、GLM-5.3 Flash の 42 点を上回り、Kimi K3 の 44 点に迫っている。この指数はプログラミング、専門業務、科学的推論など 10 項目のテストを統合したものである。


ただし、高スコアには大量の token 消費が伴う。最高推論強度では、Haiku 5.5 は評価タスクあたり平均約 16.2 万 tokens を出力し、GPT-6 Luna の 3.2 倍に達する。両者の基本 API 単価は同じだが、Haiku 5.5 の推定タスクあたりコストは約 0.21 ドル、Luna はわずか 0.07 ドルである。Haiku 5.5 を次高檔から最高檔に上げても、総合スコアはわずか 2 点しか増えず、出力量は約 80% 増加する。


推論強度を下げると、差は明らかに縮小する。Haiku 5.5 は high 檔で 38 点を獲得し、タスクあたり平均約 5.5 万 tokens を出力、最高檔の GPT-6 Luna の 38 点と 5 万 tokens に近い。開発者は推論強度を調整することで、不要な token 消費を削減できる。


Haiku 5.5 が全面的に優れているわけでもない。AutomationBench-AA 自動化タスク評価では、35% しか得られず、Luna の 53% に後れを取っている。ただし、テスト期間中にモデルがタスク実行を過度に拒否する問題があった。Anthropic は修正中で、Artificial Analysis は再テストを予定している。また、現在公表されている Haiku 5.5 のタスクコストには長コンテキスト割増が含まれておらず、実際の費用はさらに高くなる可能性がある。

訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了