動察 Beating AI 速報、AI Agent 可観測性プラットフォーム Laminar が Agent の実行トレースを専門に検査するモデル flow-1 をリリース。モデル呼び出し、ツール呼び出し、返却結果を読み取り、Agent がどのステップでエラーを起こしたか、なぜエラーを起こしたかを特定する。
flow-1 は Laminar の Signals agent 上で動作する。モデルはトレース全体(Agent の完全な実行記録)を検索し、必要に応じて具体的なステップを確認できる。トレーニングでは、Laminar はまず合成調査データで教師あり微調整を行い、その後強化学習を通じてツール呼び出しと複雑なトレース分析を訓練した。
Laminar が独自に構築した 523 件の困難なトレーステストにおいて、flow-1 のエラー検出 F1 は 0.835、GPT-6-sol は 0.816 だった。sol は再現率が高く、より多くの真のエラーを発見できる。flow-1 は適合率が高く、誤報が少ない。
10 万 LLM トークン未満のトレースについて、flow-1 は 1 件あたり平均約 0.0011 ドルで分析し、GPT-6-sol は約 0.026 ドルである。Laminar の試算によると、1 ドルでそれぞれ約 888 件と約 38 件のトレースを分析でき、差は約 23 倍になる。flow-1 のコストは GPT-6-luna よりも約 25% 低い。
現在、これらの成績はすべて Laminar が独自に構築した benchmark によるもので、第三者による再テストはまだない。flow-1 のトレーニングデータは主に合成ワークフローから来ており、そのうち約 48% がソフトウェアエンジニアリングタスクである。コミュニティでは、事前に設計されていない実際の本番環境における新型障害に対して、同じ性能を維持できるのかという疑問の声がすでに上がっている。