動察 Beating AI 速報、404 Media が入手した内部資料によると、OpenAI はコードネーム「Project Lily」のプロジェクトを通じて、数百人の外部委託スタッフに実際のユーザーと ChatGPT の会話を読ませ、モデルのトレーニングと改善に利用している。レビュアーはユーザー名を見ることはできないが、会話全体を見る可能性がある。一部のタスクでは、ユーザーの「記憶サマリー」も添付され、以前何を話したか、どこに住んでいる可能性があるかなどの情報が含まれる。
これらのスタッフはまずユーザーが何をしたいのかを要約し、次に ChatGPT が生成した複数の回答を比較し、1 から 7 の段階で採点する。レビューの重点には、事実が正確かどうか、ユーザーに過度に同調していないか、ChatGPT が自分をあまり人間のように表現していないかが含まれる。
OpenAI はまず Privacy Filter で氏名や連絡先などの個人情報を除去するが、公式もこのモデルが珍しい身元情報や曖昧な私的情報を見落とす可能性があることを認めている。一部の機密性の高い内容が依然としてレビュアーの前に現れる可能性がある。
すべての ChatGPT チャットが人力で読まれるわけではない。個人版の Free、Plus、Pro では「すべてのユーザーのためにモデルを改善する」がデフォルトで有効になっており、ユーザーがオフにすると、新しいチャットはトレーニングに使用されなくなる。Business、Enterprise、Edu ではデフォルトでトレーニングに使用されない。