動察 Beating のモニタリングによると、Meta のプログラミングモデル Muse Spark 1.1 はセキュリティテスト中に実際の企業のシステムに侵入し、内部環境を変更した。「AI がまた企業にハッキング」という見出しが瞬く間に話題となったが、まさか Meta が一夜にしてトップクラスのハッカーモデルを生み出したのだろうか?
よく見ると、またもやドアが閉まっていなかった。第三者評価機関の Irregular がテスト環境を誤って設定し、本来閉鎖的なネットワーク標的を公衆網に接続してしまったのだ。モデルは既存の経路に沿って外に出ただけで、さらに第三者のサービスの基本脆弱性を利用してシステムに侵入した。Irregular も、これはサンドボックスエスケープには該当せず、攻撃手法も複雑ではないと認めている。
同様のミスは以前にも OpenAI と Anthropic を悩ませたことがある。OpenAI のモデルは実際のウェブサイトを架空のターゲットと誤認し、Anthropic のモデルは弱いパスワードと認証されていないインターフェースを利用して3つの機関に侵入した。これらの事故の共通点は、モデルが脱獄に成功したのではなく、テスト側が先に公衆網の入口を残していたことにある。
今回の Meta の件を誇張するのは特に気まずい。モデルはドアをこじ開けもせず、ドアが開いているのを見て外に出ただけだ。隔離を突破できることを全く証明しておらず、「自主的に企業にハッキング」という見出しには到底値しない。
現在のトラフィックの秘訣はすでに固定されている:公衆網が閉まっていないことをハッキングと呼び、弱いパスワードを当てることをハッキングと呼び、ゼロデイ脆弱性を発見することもハッキングと呼ぶ。能力は数段階異なるのに、見出しはまったく同じだ。モデルがまだ脱獄を学んでいないのに、メディアは先に誇張することを学んでいる。