lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

LaminarはAgentのエラー調査コストをGPT-6-solの1/23に抑えた

動察 Beating AI 速報、AI Agent 可観測性プラットフォーム Laminar が Agent の実行トレースを専門に検査するモデル flow-1 をリリース。モデル呼び出し、ツール呼び出し、返却結果を読み取り、Agent がどのステップでエラーを起こしたか、なぜエラーを起こしたかを特定する。


flow-1 は Laminar の Signals agent 上で動作する。モデルはトレース全体(Agent の完全な実行記録)を検索し、必要に応じて具体的なステップを確認できる。トレーニングでは、Laminar はまず合成調査データで教師あり微調整を行い、その後強化学習を通じてツール呼び出しと複雑なトレース分析を訓練した。


Laminar が独自に構築した 523 件の困難なトレーステストにおいて、flow-1 のエラー検出 F1 は 0.835、GPT-6-sol は 0.816 だった。sol は再現率が高く、より多くの真のエラーを発見できる。flow-1 は適合率が高く、誤報が少ない。


10 万 LLM トークン未満のトレースについて、flow-1 は 1 件あたり平均約 0.0011 ドルで分析し、GPT-6-sol は約 0.026 ドルである。Laminar の試算によると、1 ドルでそれぞれ約 888 件と約 38 件のトレースを分析でき、差は約 23 倍になる。flow-1 のコストは GPT-6-luna よりも約 25% 低い。


現在、これらの成績はすべて Laminar が独自に構築した benchmark によるもので、第三者による再テストはまだない。flow-1 のトレーニングデータは主に合成ワークフローから来ており、そのうち約 48% がソフトウェアエンジニアリングタスクである。コミュニティでは、事前に設計されていない実際の本番環境における新型障害に対して、同じ性能を維持できるのかという疑問の声がすでに上がっている。

訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了