動察 Beating AI 速報、上海交通大学が清華大学、字節跳動、小紅書、上海 AI Lab などのチームと共同でレビュー論文「The Last AI Built by Humans」を発表し、491 件の関連研究を整理して、ますます広がる「AI の自己進化」により厳格な線引きを試みている。
論文では、再帰的自己改善(RSI)を 5 段階に分類している。L1 は人間が定めた改善プロセスを実行するだけ;L2 は自分でどのように改善するかを決められる;L3 は次のラウンドで何を学ぶべきかまで自分で決められる;L4 は実際の運用中のフィードバックに基づき、記憶、スキル、コード、または harness を継続的に修正し、これらの変更をその後のタスクに影響させる;L5 になると、次の改善ラウンドを生み出す検索方法、評価器、研究戦略そのものも修正でき、それを次のラウンドに引き継いで使用できる。
したがって、単に「自分のコードを書き換えられる」だけでは不十分である。例えば、ある Coding Agent が自分のソースコードを書き直せても、次世代をどう選ぶか、どの基準で採点するか、どの修正が残るかを依然として人間が固定しているなら、それは自己修正ができることを示すにすぎず、完全な再帰的自己改善を掌握しているわけではない。
論文ではさらに、最高段階の L5 を 2 層に分解している。第 1 層は「形式的再帰」:AI がすでに、その後の改善を担う仕組みを修正でき、次のラウンドでもそれを引き続き使用できる。第 2 層は「本当に改めるほど強くなる」:修正後の仕組みが、同程度のリソースと独立した評価の下で、実際により強い次世代を生み出せなければならない。
491 本の論文のうち、43.8% が L1、31.6% が L2 に分類され、L5 はわずか 29 本で 5.9% を占めるにとどまる。多くの研究は実際には、人間が設計した改善の実行や、改善方法の自動探索に依然として集中している。「どのように改善するか」という仕組みそのものを AI に委ねる研究は非常に少ない。たとえ L5 に触れていても、長期的に安定して優位を蓄積できることはまだ証明されていない。
この論文は主に、RSI 領域に分類枠組みを確立しようとしている。L1 から L5 は著者が提唱する基準であり、まだ業界で広く認められた統一的分級ではない。論文では同時に、学術論文、技術報告、公式ブログ、オープンソースシステムも対象に含めている。というのも、多くの最先端の RSI 実践はまだ正式な論文にはなっていないからである。