動察 Beatingのモニタリングによると、再帰的自己改善がますます具体的にHarnessに実装されつつある。最近のPiとDeepSeek Harnessの2つの設計は、ちょうど2つの重要な基盤を補完している。1つはAgentを十分に長く稼働させること、もう1つはAgent自体を十分に変更しやすくすることだ。
Piの最新Harness V3仕様は、Agentを復元可能な永続ランタイムとして設計している。モデルリクエストとツール呼び出しの前に実行意図を記録し、完了後に結果と次の状態を書き込む。プロセスがクラッシュした場合、システムはタスクがどこで停止したか、どの操作を安全に再実行できるか、どの操作に副作用があり再実行できないかを把握できる。Agentが長期稼働するには、まず一度のクラッシュで最初からやり直すことがあってはならない。
DeepSeek Harnessはもう半分を補完する。Cordisはモデルアダプター、ツールシステム、セッションログ、さらにはAgentループまでをコンポーザブルなコンポーネントとして設計している。また、クリエイティブモードではAgentが実行時にCordis環境を検査し、新しいコンポーネントを一時的に定義、ロード、アンロードできるようにしている。
Piは実行状態の継続を可能にし、DeepSeekはAgentの構成構造の動的な再編成を可能にする。
これはまさに翁荔が7月にHarnessと再帰的自己改善について議論した際に示した方向性である。近い将来のRSIは必ずしもモデルが直接重みを書き換えることから始まるわけではなく、より現実的なルートはまずコンテキストとワークフローを最適化し、次にHarnessコードに深く入り込み、最終的には「Harnessをどう最適化するか」自体が最適化の対象になることだ。
現在まだ欠けているのは3つ目の要素、すなわち正確な検証である。自己進化Agentの研究では、評価と安全性が核心的な問題として挙げられている。Agentは長期稼働でき、自身を変更できるが、「何が進歩か」まで一緒に変更できてしまうと、自分のテストに合格するために最適化しやすくなる。翁荔も特に、verifier、tracer、セキュリティ境界は自己変更ループの外側に置くべきだと強調している。
したがって、真のRSIループを実現するには、少なくとも3つのことを解決する必要がある:長く稼働すること、変更できること、正確に検証できること。Piは1つ目を補完し、DeepSeekは2つ目を補完している。3つ目は、この「進化」が最終的に本当の能力向上になるのか、それとも自分で作った試験に合格することを学んだだけなのかを決定づける。
自分自身を変更できることは進化の始まりに過ぎず、自分が本当に強くなったことを証明できることこそが、RSIの最も難しい最後の1マイルである。