動察 Beating AI 速報、Scale AI が RSI Bench を発表。AI が研究者のように自ら AI 開発を行えるかを専門にテストするものだ。
AI は論文、コード、計算リソースを直接受け取り、自分で実験を考え、トレーニングを実行し、手法を改良し、元の AI をより良くできるかを検証する。
最初のテストでは Claude Opus 5 と GPT-5.6 Sol が使用された。両モデルはすでに自分で実験を実行し、パラメータを調整し、イテレーションを重ねることができ、一部のタスクでは確かに与えられたベースラインを超える結果を出せた。
しかし、現在の AI はまだ「発明」する能力が十分ではない。最新の研究に挑戦させると、ほとんどの試みは論文の既存手法やパラメータ調整に留まり、真に新しいアイデアを提案することはほとんどない。