Anthropicは、今後のClaudeモデルが生成テキストにウォーターマークを含む仕組みを説明した。EU AI Actへの対応として、AI生成コンテンツの識別可能性が求められるなか、生成文の品質を変えずに判定の手がかりを残す方法が注目される。
見えないが検出できるパターン
Anthropicによると、ウォーターマークは文字を追加したり隠し文字を埋め込んだりするものではない。モデルが次の単語を選ぶ際の低リスクな選択に、鍵に基づくパターンを反映させる方式で、読者には区別できないが、鍵を持つ側はClaudeが関与した可能性を確率的に判定できる。
同社は、品質、創造性、読みやすさ、コスト、トークン数に実用上の影響はないと説明する。また、ウォーターマークは個人、組織、特定チャットを識別する情報を含まないとしている。
方式 | 単語選択のランダム性に検出可能なパターンを残す |
|---|---|
読者への見え方 | 通常の文章と区別できない |
個人識別 | 特定ユーザーやチャットを追跡する情報は含まない |
企業利用での論点
社内文書、広告、教育、採用、カスタマーサポートなどでAI文が増えるほど、生成物の来歴管理は重要になる。透かしは万能な証明ではないが、開示義務、監査、ブランド保護のための一つの手段になる。
注意点
短文、編集済み文章、翻訳、複数モデルを経た文章では検出精度や解釈が難しくなる可能性がある。企業は透かしだけに頼らず、生成時ログ、レビュー記録、利用ポリシーを組み合わせるべきだ。


.png&w=384&q=75)

