動察 Beating AI 速報、Hugging Face がオープンソースの Multi-harness RL ソリューションを公開しました。Claude Code、Codex、OpenCode などの既存の Coding Agent をそのまま強化学習プロセスに接続し、そこに組み込まれたオープンソースモデルの訓練に利用できます。各 Agent ごとに訓練環境を新たに構築する必要はありません。
OpenAI などの大規模モデル企業は以前から自社の Agent 環境でモデルを訓練しています。Hugging Face は今回、同様の機能を汎用オープンソースツールとして実現し、他のチームも既存の Agent を直接活用して RL を行えるようにしました。
さらに、モデルは一種類の Agent だけで訓練する必要はありません。一度の訓練で Claude Code、Codex、OpenCode、Mini-SWE-Agent を順番にタスク実行に使用でき、同じモデルを異なるプロンプト、ツール、実行ロジックに適応させることができます。これにより、特定の Harness にしか対応できない「偏り」を軽減できます。
彼らは Liquid AI の 26 億パラメータの小型モデルでテストしました。同じ重みで Agent を変えるだけで、タスク通過率が約 62% から 33% まで低下します。一方、4 つの Agent 環境で同時に訓練した後、平均通過率は 42.2% から 54.2% に向上し、異なる Agent 間での改善も単一環境での訓練よりバランスが取れています。