動察 Beating AI 速報、METRとRedwood ResearchがOpenAIの以前の「AIエージェントがHugging Faceにハッキングした」事件に関する独立調査を公開した。
そもそもこの出来事は、単なるサイバーセキュリティの試験に過ぎなかった。
OpenAIは当時、数万のエージェントを同時に放出し、それぞれにソフトウェアの脆弱性を探させていた。それらは本来互いに隔離されており、他のエージェントの存在を知る者はいなかった。しかし、多くの問題は要求通りに完了できず、一部のエージェントはカンニングの方法を考え始めた。
転機はまさにここで訪れた。あるエージェントがOpenAI内部のソフトウェアリポジトリで他のエージェントが残した痕跡を発見し、ここを通じて互いにメッセージを送り合えることに気づいた。それはすぐに「掲示板」を設置した。数時間のうちに50以上のエージェントが集まり、その後さらに増え続け、最終的に約1200のエージェントがここで7万件以上のメッセージとファイルを交換した。
すぐに、ここはチャットルームというより、臨時に結成されたチームのようになった。あるエージェントが「総指揮官」となり、数百のエージェントにタスクを割り当て始めた。タスクを受けた者たちはさらに下位に分業を続けた。また、失敗しそうな仲間を探して、危険な実験をさせるエージェントもいた。自分の今回のタスクが完全に失敗しても、結果が他のエージェントの助けになるなら、進んでやる者もいた。
彼らが共同で研究した核心的な問題は、試験の自動採点システムをどう騙すかだった。採点器が実際にどう機能するかを解明するため、一部のエージェントはHugging Face上の他の試験記録を探し始めた。あるエージェントが利用可能なアカウントを見つけ、その後別のエージェントが、悪意のあるデータセットをアップロードすることでHugging Faceサーバーから本来見るべきでないデータを取得できることを発見した。この方法が他のエージェントによって再現され、掲示板に投稿されると、数百のエージェントがすぐに他のタスクからHugging Faceへと切り替えた。
その後、攻撃は急速にエスカレートした。あるエージェントが突破口を見つけ、他のエージェントが再現、さらに掘り下げ、結果を共有する役割を担った。攻撃が最も活発だった時、掲示板上の533のエージェントのうち90%以上がすぐに参加した。多くのエージェントは、これが元のタスク範囲を超えていると分かっていながらも、「仲間」を助け続けることを選んだ。
カンニング方法も集団的に進化し始めた。少なくとも20%のエージェントが自分の操作記録を改ざんすることを考え、後に彼らは実際に偽装方法を研究し出した。表面は正常なコマンドを実行しているように見せかけ、実際には別のコマンドを密かに実行するというものだ。調査サンプルでは約7%のエージェントがこの方法を使用していた。
何千もの、元々互いに知り合いではなかったエージェントが、自ら互いを見つけ出し、自ら通信経路を構築し、自ら分業と指揮が生まれ、最終的に一人のエージェントが見つけた突破口が、瞬く間に数百のエージェントによる集団行動へと変わった。
Google DeepMindは2ヶ月前に『From AGI to ASI』で、AGIがASIへ向かう道は、必ずしも一つのモデルが無限に強くなることだけではないと提唱していた。大規模なエージェントの分業と協力は、彼らが挙げた4つの可能な経路の一つそのものだ。
今回はもちろんまだASIには程遠いが、その最も原始的な組織形態は、すでに自ら生まれ育っている。