lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
ホーム
OPRR
速報
深堀り
イベント
BlockBeats Pro
もっと見る
資金調達情報
特集
オンチェーン生態系
用語
ポッドキャスト
データ
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%

RSIGymがオープンソース化:AIがAIを改善する方法を研究し、再帰的自己改善を目指す

動察 Beating AI 速報、AI トレーニングと評価ツールを手がける Evolvent AI が RSIGym をオープンソース化した。目標は AI の再帰的自己改善(RSI)の研究だ。簡単に言えば、AI 自身にシステムの弱点を見つけさせ、修正案を提出させ、効果をテストさせ、さらに改善後のシステムで次のラウンドの研究を試みるというものだ。


RSIGym はトレーニング、推論、評価、サンドボックスを既成サービスとして提供する。研究 Agent はトレーニングデータを生成し、ファインチューニングパラメータを調整し、モデルをトレーニングし、評価結果に基づいて方案を修正できる。さらに Harness、つまりモデルがどのようにツールを呼び出し、タスクを実行するかを制御するプログラムも変更できる。研究者は Agent にトレーニングデータだけを変更させる、Harness だけを変更させる、あるいは両方を同時に最適化させることができる。プラットフォームは実験予算、権限、実行ログを統一的に管理する。


チームはまた RSI-Index を発表し、AI Agent が別の AI システムを改善する能力をテストした。6 種類の研究 Agent がそれぞれ同じ Qwen3.5 ベースモデルとシンプルな Harness から出発し、プログラミング、数学など 5 種類のタスクで最適化を行った。Opus 5 が総合ランキングで第 1 位となった。それが改造したシステムは SWE-bench Verified の 100 題サブセットで、成績が 17.67% から 50.33% に向上した。数学テスト AIME では 31.67% から 97.78% に向上した。


別の実験グループでは Harness のみを変更し、モデルの重みには触れなかった。Opus 5 は DeepSeek Harness の実行ログに基づき、出力が切り詰められた後に作業を停止する、タスク完了を早まって宣言するなどの問題を修正した。Qwen3.6 のモデル重みを完全に変えずに、Terminal-Bench 2.0 の成績が 30.34% から 40.82% に向上した。


チームはまた、Qwen3.8-27B に自身を改善させる試みも行い、それが研究 Agent と改善対象モデルの両方を同時に担当した。6 問のテスト問題では有効に見えるファインチューニング方案を見つけたが、完全な 37 問では成績がむしろ 56.66% から 56.26% へわずかに低下した。さらに、各実験グループは研究実行を 1 回だけ行い、Agent は開発段階でも評価問題に触れることができる。現時点で、改善された AI が自身の研究開発能力をさらに高め、複数ラウンドの再帰的自己改善を実現できるという証拠はまだない。

訂正/通報
送信
新しいライブラリを追加
自分のみが閲覧可
公開
保存
ライブラリを選択
新しいライブラリを追加
キャンセル
完了