動察 Beating AI 速報、Anthropic が正式に「組み込み型評価」の実装を開始。アクセンチュア傘下の AI 企業 Faculty が Anthropic 内部に人員を派遣し、モデルの評価とレッドチーミングテスト、アラインメント評価を行い、安全対策を検査する。
これは通常の外部評価とは大きく異なる。評価員は従業員に近い権限を付与され、モデルのトレーニングプロセスを閲覧し、開発・展開の意思決定を把握し、内部従業員と直接コミュニケーションを取ることもできる。
両者は今後5年間で少なくとも各10億ドルを投じ、この評価体制を構築する。Anthropic も、現在業界には統一ルールすら存在せず、評価員が具体的に何を閲覧できるか、結果をどう公開するか、費用を誰が負担するかはまだ定まっていないことを認めている。現時点でアクセンチュアの評価業務は Anthropic が直接支払っている。
しかしアクセンチュア自体が Anthropic の長期的な戦略パートナーであり、専用の Anthropic Business Group を設立し、約3万人に Claude の使用方法を研修している。AI Evaluator Forum が同日に提示した最低条件の一つは、まさに評価機関が被評価企業と重大な商業取引関係を持つべきではないというものである。
Anthropic は今後他の評価機関も導入する予定であり、METR(これも Anthropic の古くからのパートナー)などの非営利組織とも試験導入を協議している。