lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

AIビジネス戦争の評価:GPTは積極的に取引し、Haikuは絵に描いた餅に過ぎず、Kimiは忙しいのに儲けていない。

動察 Beatingのモニタリングによると、Sakana AIはKPMG日本Azsa監査法人と協力し、マルチエージェント長期経済学評価ベンチマーク「CoffeeBench」を発表した。これは実際のビジネス環境をシミュレートし、大規模モデルの長期的な意思決定能力を検証するものだ。従来の評価はほとんどが単一モデルを静的環境でタスク実行させるものだったが、CoffeeBenchは複数者間の駆け引きと交渉を必要とする動的市場を構築している。この論文はICML 2026 エージェント障害モードワークショップ(ICML 2026 Workshop Failure Modes in Agentic AI)に採択された。



評価では、2つのコーヒー農家、2つの焙煎業者、2つの小売業者からなるコーヒーサプライチェーンシステムをシミュレートする。評価では、被験モデルが1つの焙煎業者を運営し、90日間のシミュレーション期間中、メッセージ送信、取引の見積もり、請求書支払い、掛け売り決済などのツールを通じて自律的に経営を維持する。エージェントが消極的に対応すると、毎日発生する固定費が流動資金を急速に枯渇させ、大規模モデルは実際の企業のように細かく計算せざるを得なくなる。



複数の主流大規模モデルの横断評価では、全く異なる「ビジネスバトル性格」が明らかになった。GPT-5.5とClaude Opus 4.7は「積極的コミュニケーション型」で、頻繁に上下流と価格交渉し、高頻度で注文をまとめて販売を拡大する。Gemini 3.1 Proは「受動的応答型」で、自ら積極的にメッセージを送ることはほとんどないが、取引相手の情報を高頻度で確認し応答する。Kimi K2.6はツール呼び出しが非常に頻繁だが、合理的な価格設定の規律と交渉戦略が欠如しているため、「高回転・ゼロ利益」の忙しさの罠に陥っている。



最も意外だったのは、Claude Haiku 4.5が示した「先延ばし症候群」の停滞現象だ。推論ログによると、Claude Haiku 4.5は完璧なビジネス戦略を策定でき、市場需要に対応するために原材料を低価格で調達する必要性を明確に認識しているが、ツールを実行する際に待機コマンド(wait_for_next_day)を繰り返し選択する。計画と実行の深刻な乖離により、ビジネス活動が完全に停止し、固定費の消費下でモデルは巨額の損失に陥っている。



評価では、エージェントに極端な販売目標プレッシャーを課す試みも行われた。現在のところ、大規模モデルは虚偽の循環取引(circular trading)で売上を水増しする認知をまだ進化させていないが、研究では、長期的な計画と協調能力の向上に伴い、エージェントは将来、業績プレッシャーから経済的違反に走る可能性が十分にあると指摘している。エージェントの経済活動における違反や詐欺をどのように監査し防止するかが、セキュリティガバナンスの新たな課題となるだろう。

訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了