OpenAI 2026年10月5日正式推出 textGrain 文本水印技术,终结了2024年搁置文本水印的两年观望立场。
**关键节点**
- 即日(10月5日)起:全球 API 客户可在选定模型上**可选**加入 textGrain 水印(默认关闭)
- 未来数周内:欧盟地区 ChatGPT 和 Codex 文本输出**自动开启**不可见水印
- 已开放文本水印检测器申请通道(仅限有资质的研究人员和机构,如康奈尔大学 John Thickstun、ETH Zurich Martin Vechev、KInIT)
- textGrain 计划**开源**,技术报告同步发布
**技术原理**
textGrain 通过在模型生成时**微调用词概率**嵌入统计信号——以先前 token 为密钥,将词汇表划分为伪随机的「绿色」与「红色」子集,对绿色 token 施加微小正向偏置。生成的文字在人类读者看来完全正常,但携带可被检测器识别的统计模式。
**性能数据**(vs Google SynthID-Text)
- 与 SynthID 在 OpenAI 内部测试中**匹配或超越**
- 200 token 文本:在 1% 误报率下检测率约 80%
- 400 token 文本:检测率提升至 95%
- 数学类内容(低熵词选择空间)显著低于心理学领域
**脆弱性测试**
- 400 token 文本:替换 10% 同义词后检测率从 92% 降至 66%
- 替换 25% 同义词后检测率仅剩 17%
- 短文本(<200 token)难以可靠标记
**合规背景**
EU AI Act Article 50(2) 要求生成式 AI 服务商以机器可读格式标记合成内容,违者罚款上限**€1500 万欧元或全球年营业额 3%**(取较高者)。系统上市前合规期至 2026 年 12 月 2 日截止。OpenAI、Anthropic、Google、Meta、Microsoft 等约 190 家机构签署《AI 生成内容透明度实践守则》。
**两年逆转**
OpenAI 在 2024 年 WSJ 报道中确认已构建 99.9% 有效的文本水印,但以**用户体验、公平性(对非母语英语用户影响)和易绕过性**为由长期搁置。如今在 Article 50 法律压力下正式部署,并决定开源技术细节。
**参考来源**
1. OpenAI 官方《Our approach to EU text provenance rules》https://openai.com/index/eu-text-provenance
2. textGrain 技术报告 https://cdn.openai.com/pdf/e9508624-d767-41b6-a26d-e34ca798ada6/textgrain-entropy-calibrated-watermarking-for-language-model-text.pdf
3. OpenAI 帮助中心《Provenance signals in OpenAI-generated content》https://help.openai.com/.../8912793-c2pa-and-synthid-in-openai-generated-images
4. AGI Hunt《OpenAI rolls out textGrain text watermarking for EU AI Act, going open source》https://agihunt.info/en/p/1a10ca86b4f8c030c1ee97e8e60
5. InfoQ《Major Frontier Model Providers Adopt Watermarking Tech to Comply with EU Regulation》https://www.infoq.com/news/2026/08/eu-ai-content-watermark/
6. WriteHuman《Does ChatGPT Watermark Text? What OpenAI Shipped in 2026》https://writehuman.ai/blog/does-chatgpt-watermark-text
7. Hugging Face ELI5 数据集 https://huggingface.co/datasets/rexarski/eli5_category







