lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

Hugging FaceはClaude CodeとCodexをRLトレーニングに直接参加させた

動察 Beating AI 速報、Hugging Face がオープンソースの Multi-harness RL ソリューションを公開しました。Claude Code、Codex、OpenCode などの既存の Coding Agent をそのまま強化学習プロセスに接続し、そこに組み込まれたオープンソースモデルの訓練に利用できます。各 Agent ごとに訓練環境を新たに構築する必要はありません。


OpenAI などの大規模モデル企業は以前から自社の Agent 環境でモデルを訓練しています。Hugging Face は今回、同様の機能を汎用オープンソースツールとして実現し、他のチームも既存の Agent を直接活用して RL を行えるようにしました。


さらに、モデルは一種類の Agent だけで訓練する必要はありません。一度の訓練で Claude Code、Codex、OpenCode、Mini-SWE-Agent を順番にタスク実行に使用でき、同じモデルを異なるプロンプト、ツール、実行ロジックに適応させることができます。これにより、特定の Harness にしか対応できない「偏り」を軽減できます。


彼らは Liquid AI の 26 億パラメータの小型モデルでテストしました。同じ重みで Agent を変えるだけで、タスク通過率が約 62% から 33% まで低下します。一方、4 つの Agent 環境で同時に訓練した後、平均通過率は 42.2% から 54.2% に向上し、異なる Agent 間での改善も単一環境での訓練よりバランスが取れています。

訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了