動察 Beating AI 速報、Googleの研究チームがDream-RSIを発表した。AI Agentが1ラウンドのタスクを終えた後、過去の成功と失敗を「夢見る」ように活用する。システムは毎回の試行と結果を保存し、それらの古い記録を使って異なるアプローチを推演する。例えば、どの道を先に試すか、いつ諦めるか、複数の案を同時に試すかどうかなどだ。結果は以前にすでに実行済みであるため、これらの推演はタスクを再実行する必要がない。
システムはそこからより良いパフォーマンスのアプローチを選び、次のラウンドに直接適用する。新しいラウンドではさらに多くの成功と失敗が残され、それをまた「夢見る」ことに使い、戦略を改善し続ける。こうしてラウンドを重ねることが、論文でいう「再帰的自己改善」である。現在、基盤モデル自体は変化せず、実際に改善されるのはAgentの「次にどうするか」という方法である。
論文では、アルゴリズム、数学的最適化、GPU kernelなど8つのタスクでこの方法をテストした。Gemini 3.1 Proのあるアルゴリズムタスクを例にとると、固定アプローチと比較して、Agentの呼び出しが550回から317回に減少し、同時に最終的に見つかったプログラムはより速く動作した。