10月6日、The Decoderが「OpenAI will watermark ChatGPT text in the EU but makes it optional for API users worldwide」と題した記事を公開した。OpenAIがEU AI Act対応としてChatGPTのテキストに透かしを導入するという発表だが、内部テストによれば単語の25%を同義語に置き換えるだけで検出率は20%以下に落ちる——導入と同時に、その限界も明示された格好だ。
EU AI Actへの対応——OpenAIが選んだ「透かし」という手段
EU AI Actは、AIプロバイダーに対してAI生成テキストを機械可読な形式でラベリングすることを義務づけている。OpenAIはこれに対し、textGrainと呼ぶ技術で応答する。
textGrainは、モデルが単語を選ぶ際に目に見えない統計的シグナルを埋め込む手法だ。仕組みとしては、AnthropicがClaudeに採用しているSynthID透かしと類似しており、SynthID自体はGoogleのオープンソースAIテキスト透かし技術をベースにしている。
OpenAIは今後数週間以内に、EU圏のChatGPTおよびCodex(OpenAIのコード生成向けAPIモデル群)ユーザー向けに透かしを有効化する予定だ。また、textGrain自体をオープンソースとして公開する計画も明らかにした。
AnthropicとOpenAIで異なる「強制度」
AnthropicがClaudeの透かしを世界規模で強制適用しているのに対し、OpenAIのAPI透かしは世界中で選択制——元記事の表現では「optional」で、EU圏外のAPI利用者は透かしを有効化するかどうかを自身で選べる形だ(デフォルトがオンかオフかについては元記事では明示されていない)。Microsoft Azureなどのクラウドパートナー経由でも同様の仕組みが数週間内に提供される。
エンジニアにとって実務上重要なのはこの点で、ChatGPTのUIを通じた利用はEU圏では透かしが強制されるが、APIを使う開発者は(EU圏外であれば)透かしの適用有無を選択できる。
検出精度の実態——編集すればすぐ消える
技術的な詳細はtextGrainの技術レポートで公開されている。内部テストの結果は以下の通りだ:
- 偽陽性率1%を目標として設定した場合、400トークン(約300語)の心理学系テキストでは透かしを約95%の精度で検出
- 同条件で200トークンに短くなると検出率は**約80%**に低下
- 数学系コンテンツでは「大幅に低い」検出率——モデルが単語を自由に選べる余地が少ないためだとOpenAIは説明している

テキストの長さとテーマにより検出率は大きく変わる。400トークンの心理学系テキストでは約94%を検出するが、数学系では約60%にとどまる。(画像:OpenAI)
編集による回避は容易
より深刻な問題として、テキストを少し編集するだけで透かしはほぼ無効化される:
- 単語の10%を同義語に置換すると、400トークン文書の検出率が約92%から**66%**に低下
- 単語の25%を置換すると検出率は17%以下に

25%の単語を置換すると、400トークンの文書でも検出率は20%を下回る。(画像:OpenAI)
この脆弱性についてOpenAIは逆説的な見方を示している。透かしを消したいユーザーはオープンウェイトモデルに移行するかもしれず、それはそれで一つの結果だという立場だ。Anthropicは自社の透かしが編集に対して「堅牢」と主張しているが、具体的な検出率データは公表していない。
また、OpenAIは透かしの検出結果から得られる情報についても明確に限定している——透かしが検出されても、ユーザーの特定、プロンプトの内容、テキストの正確性、人間による編集量などは一切わからない。逆に透かしが検出されなくても、人間が書いた証明にはならない(テキストが短すぎる、翻訳されている、対応外のモデルを使っている等の理由で検出を逃れる場合がある)。
検出APIへのアクセスは当面限定——ただしオープンソース化で自前実装の道も
textGrainの検出器にアクセスできるのは、当初は選定された研究者や専門機関のみで、EUのAIコンテンツに関する行動規範(Code of Practice)のもとで申請制となる。申請は専用フォームから行う。Anthropicも検出APIで同様のアプローチを取っている。
OpenAIがアクセスを制限する理由として、偽陽性(透かし無しのテキストを透かしありと誤検出)や検出漏れのリスクを挙げている。「結果を責任ある形で解釈できると判断した時点で」アクセスを拡大するとしているが、具体的な時期は示していない。
一方で、OpenAIはtextGrain自体をオープンソースとして公開する計画も明らかにしている。これが実現すれば、検出APIへのアクセスを待たずに、研究者や開発者が独自の検出器を実装・検証する道が開ける。透かし技術のエコシステムをOpenAI外にも広げる狙いがあると見られるが、同時に回避手法の研究が加速するリスクも伴う点は注目に値する。
なお、画像・音声向けの既存検証ツール(openai.com/verifyおよびContent Provenance API)は引き続き一般公開されている。
詳細はOpenAI will watermark ChatGPT text in the EU but makes it optional for API users worldwideを参照していただきたい。