動察 Beating AI 速報、アメリカ・フロリダ州の女性がClaudeのプライベートチャットで銃撃脅迫を書き込んだため、Anthropicの安全システムにフラグ立てされた。会話はその後、人手による審査に回され、審査チームが内容を警察に引き渡した。女性は逮捕され、現在重罪の罪に問われている。地元警察によると、彼女は後にAIを「日記」として使っていたと説明したという。
警察の逮捕報告書によると、彼女はまずリー郡保安官事務所を襲撃すると書き込み、翌日には新しい銃を手に入れたばかりだと述べた。これはClaudeが自ら通報を決めたのではない。システムがまず潜在的な脅威を識別し、深刻な内容をAnthropicの人手チームに引き渡し、人間が法執行機関に連絡するかどうかを判断する。
Anthropicの消費者向け利用規約にはもともと、会社が独自の判断でユーザーの入力、出力、または操作を法執行機関に報告できると明記されている。公式プライバシーポリシーも、人員や財産に深刻な危害を防ぐために必要と判断した場合、警察と個人データを共有することを許可している。たとえユーザーがモデルトレーニングをオフにしても、安全上の問題でフラグ立てされた会話は依然として安全審査に入る可能性がある。
事件自体には法的な争点もある。フロリダ州法は、この種の書面または電子的な脅迫が「他人が閲覧可能な」方法で送信または伝達されることを要求している。地元の弁護士は、AIに宛てたプライベートチャットをこの法律に当てはめるのは簡単ではないと考えている。現在、女性は起訴されているだけで、まだ有罪判決は下されていない。
これも孤立した事例ではない。Tom's Hardwareの集計によると、8月以来、少なくとも3件のAnthropicのチャット内容が警察の視野に入っている。以前、あるClaudeユーザーが会話の中でAnthropicのCEOであるDario Amodeiを脅迫し、Anthropicがその後自らサンフランシスコ警察に連絡した。