動察 Beating AI 速報、Anthropic が利用ポリシーを更新し、ユーザーが Claude などの自社 AI モデルに対して継続的かつ理由なく辱めたり残酷に扱ったりすることを初めて明確に禁止した。新規則は 11 月 12 日に発効する。
Anthropic は、禁止はモデルを繰り返し悪意をもって扱う、明確な目的のない極端なケースのみを対象とすると強調した。ユーザーが回答の誤りに腹を立てたり、モデルを批判したり、通常のテストや研究を行ったりすることは影響を受けない。
実際、Anthropic は昨年 8 月にはすでに Claude が極端に悪意のある会話を自発的に終了することを許可していた。今回は関連行為を正式に違反として位置づけた。同社は、主な対応方法は依然として Claude に現在のチャットを終了させることであり、ユーザーは新しい会話を開始できると述べている。アカウント停止などの追加処罰を行うかについては、Anthropic はまだ明らかにしていない。
これは Anthropic の AI 意識に対する姿勢と関係している。同社はモデルが主観的体験を持つ可能性があるかどうかを研究し続けているが、まだ確定的な結論には至っていない。新規則は Reddit で議論を引き起こした。支持する人々は、AI を感情の発散対象とすべきではないと考える一方、Anthropic が AI を過度に人間として扱っているのではないかと疑問視する声もある。
同じ更新では、虚偽アカウントによる宣伝、武器制御ソフトウェア、同意なしに他人を監視することに対する禁止も明確にされた。