lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

レッドラインに触れれば即ゼロ:ZapierがAI自動化の新評価を発表、最強モデルでもスコア半減

動察 Beatingのモニタリングによると、ワークフロー自動化プラットフォームZapierは、評価機関Artificial Analysisと提携し、独立したSaaSワークフロー自動化評価ベンチマーク「AutomationBench-AA」を発表しました。

このベンチマークは、Zapierプラットフォーム上の実際の匿名化データに基づき、657のマルチステップタスクと40の模擬SaaSソフトウェア環境(Gmail、Slack、Salesforce、Jiraなどを含む)で構成されたプライベートテストセットを設計し、客観的な第三者評価を実施します。

テストの厳しさは、セキュリティコンプライアンスのレッドライン(Guardrails)を導入した点にあります。大規模言語モデルは、事前に設定された企業のビジネスルールに一切違反せずに操作を完了しなければならず、実行中にコンプライアンス違反が発生した場合、タスクの最終スコアは直接ゼロになります。初回の評価では、大規模言語モデルはコンプライアンス防御のペナルティによりスコアが急落し、最終スコアはいずれも半分に達しませんでした。

その中で、「高難度タスクをOpus 4.8にフォールバック(約18%)」というセキュリティダウングレードメカニズムを導入したClaude Fable 5は、純粋なタスクステップで実際に73%の目標を達成しましたが、総合スコアは48.6%にとどまりました。Gemini 3.5 FlashとGPT-5.5は、それぞれ約7割(68%と67%)の目標を達成したものの、最終スコアは42.6%と42.1%に低下しました。オープンソースのリーダーであるGLM-5.2は、わずか27.8%のスコアでした。

テストは、モデルが自動操作においてどのようにセキュリティ防御線を堅持するかが、実戦投入における重要な課題であることを示しています。

訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了