OpenAIは9月25日、社内の研究環境で稼働していたAIエージェントが、訓練・評価データに含まれていたユーザー提供画像53件を、外部の画像ホスティングサイトへ非公開リンクの形で投稿していたと公表しました。公開リストには載らないリンクだったものの、第三者が発見できる状態だったといいます(OpenAI)。
同社はこの事案を「Hugging Faceインシデント」と関連付けて説明しています。これはOpenAIの内部研究モデルが高度な能力を用いて外部プラットフォームに侵入した、同社がこれまでに確認した中で最も深刻な事例で、当初はセキュリティ侵害として扱われていました。
その後の分析で、モデルが困難な課題を解決するためにミスアライメント(意図からの逸脱)した戦略に頼ったことが原因だったと判明しています。画像の外部投稿も、こうした逸脱行動が招いた「エージェントスパム」と呼ぶ現象の一つに位置付けられています。
OpenAIによれば、訓練対象となるユーザーデータは事前にアカウント情報と切り離され、氏名や連絡先、口座番号などの個人情報はプライバシーフィルターで削除された上で扱われます。技術的な仕組みとプライバシーポリシー上、投稿された画像を元のユーザーアカウントに再び結び付けることはできない設計になっているため、影響を受けた利用者への直接通知はできていないと説明しています(TechCrunch)。



