OpenAIは月曜日、EUの規則に基づくChatGPT生成文章向けテキスト電子透かしの仕組みを詳しく説明しました。当初、検出機能は一般向けではなく研究者に限定されます。
要点
OpenAIは、EUの規則に基づくChatGPT生成文章向けのテキスト電子透かしについて詳しく説明しました。当初、検出機能は研究者に限定されます
EU AI法は、汎用AIの提供者に対し、合成テキストを機械で読み取り可能にし、人工的に生成または改変されたものとして検出できるようにすることを義務付けています
OpenAIの手法では、ChatGPTがトークンを選択する際に統計的なパターンを埋め込み、一致するアルゴリズムで検出できるようにします
文章の言い換えや機械翻訳によってウォーターマークの信号が弱まる可能性があるが、OpenAIは敵対的攻撃に対する堅牢性の数値を公表していない。
OpenAIのテキスト・ウォーターマークとEU規制への準拠
この投稿では、ウォーターマークが適用される範囲、外部の関係者が検出する方法、そしてOpenAIが研究者から導入を始める理由が説明されている。
EU AI法は、合成テキストを生成する汎用AIシステムの提供者に対し、出力を「機械可読な形式で表示し、人工的に生成または操作されたものとして検出可能にする」ことを義務付けている。これにより、ユーザーやプラットフォームではなく、OpenAIのような企業がコンプライアンス上の責任を負うことになる。
OpenAIの投稿によると、ChatGPTがテキストを生成する際に選ぶトークンに、統計的なパターンを埋め込むという。この手法は、人間の読者には分からない形で単語の選択を変える一方、対応するアルゴリズムで検出できる。
関連記事:OpenAI、NSW政府サイトへの2度目の不正エージェントによるハッキングを明らかに
OpenAIは、テキスト・ウォーターマークの検出ツールをまず限られた研究者グループに提供し、その後に一般公開する予定だと述べた。保護策の検証前に悪意ある者がパターンをリバースエンジニアリングするのを防ぐには、段階的な導入が必要だとしている。
汎用モデルに関するEU AI法の透明性規定が8月に施行された。段階的な導入の一環として、すでにAI研究機関には学習データとリスク評価の文書化が義務付けられている。
OpenAIにとって、運用上の課題は、自社のラベリングシステムが精査に耐え、機械生成テキストを検出可能な状態に保つという規則の要件を満たせるかどうかだ。今回のウォーターマークの開示により、コンテンツのラベリングに関するコンプライアンス対応も進むことになる。
規制上の形式的な要件を超える重要性
AI生成テキストが教室、報道機関、ソーシャルメディアをあふれさせるなか、信頼性の高い研究機関に裏付けられた検出手法は、他の法域が参考にする標準となる可能性がある。GDPRの同意に関する枠組みが欧州域外でも世界的なひな型となったのと同様だ。
まだ解決していないのは、意図的な除去に対してウォーターマークがどれほど堅牢かという点だ。文章の言い換えや機械翻訳によって、トークンの正確な選択に依存する統計的な信号が弱まる可能性がある。
OpenAIは月曜日の投稿で、敵対的攻撃に対する堅牢性の数値を公表しなかった。そのため、検出ツールへのアクセスが広がった後に、独立した研究者がこの主張を検証することになる。
関連記事:Bitmineのイーサリアム保有量が600万トークンを突破、価値は164億ドルに