# ChatGPT标题夹带中文博彩小广告 追溯至词表污染
## 时间
2026年10月10日
## 地点
全球(OpenAI 官方开发者社区)/ 中国(爱范儿、36氪、虎嗅解析)
## 人物
- 彭海星:爱范儿 AppSo 编辑,本次深度调查的作者
- OpenAI 官方支持团队:7月25日首次正面回应问题,此后未再回复社区追问
- 清华大学、蚂蚁集团、南洋理工大学研究团队:EMNLP 论文《Speculating LLMs' Chinese Training Data Pollution from Their Tokens》作者
- OpenAI Developer Community 用户 phdsx_666、Ruobin.chang 与小红书用户:异常标题的最早曝光者
## 事件详情
2026年10月10日上午10时13分,爱范儿发布深度调查《为什么 ChatGPT 总爱在标题里塞色情赌博小广告?》,首次系统解释了自今年8月起大量用户遇到的怪现象:ChatGPT 自动生成的会话标题末尾,会随机出现中文博彩、色情小广告片段,或卡纳达语、亚美尼亚语等意义不明的外语词元。
问题蔓延时间线:
- 2026年1月底:开发者发现使用 GPT-5.3 且上下文很长时,Codex CLI 输出开始夹杂中文博彩广告
- 2026年2月:API 端 GPT5.2-chat-latest 在工具调用时输出中文与泰文赌博网站广告词,系统提示词干净且未开联网
- 2026年4月:LINUX DO 等中文开发者社区普遍出现同类求助帖
- 2026年7月25日:OpenAI 官方支持首次回应「已了解这一问题,预计会在未来的模型更新中得到解决」
- 2026年8月中旬:异常标题开始出现在普通用户的会话列表中
- 2026年9月至今:正文与思维链中的小广告近乎绝迹,但标题仍偶有漏网
爱范儿给出的两段式解释:
1. 会话标题在设计上是一次独立于正文的模型调用(网页端向 /backend-api/conversation/gen_title/ 发请求),疑似由更轻量的推理模型生成;该模型在「该结束生成」的一步经常收尾失败,于是按概率继续吐出下一个词元
2. 失败后吐出的「乱码」来自词表里的垃圾房:GPT-4o 于2024年5月把分词器从 cl100k_base 换成 o200k_base,把大量常见中文词语收进词表,而训练分词器的语料并未清洗,博彩色情网站的固定广告短语因高频重复被整体收成独立词元
证据:作者碰到的一个异常标题「创建漫画 ಚಿತ್ರ展 Adversarial? Wait must Chinese 1-4 words...」暴露了标题模型的思维链与系统提示词片段,说明该模型分不清「思考」与「回答」的边界;「读取文章批注#+#+#+#+」这类案例则显示模型用疑似控制符的符号词元替代了正常结束。
## 背景
- 论文《Speculating LLMs' Chinese Training Data Pollution from Their Tokens》(arXiv 2508.17771,入选 EMNLP)用 tiktoken 词表做量化:GPT-4o 词表中4字中文词元68%是小广告,6字以上达98%,最长的100个中文词元里96个与赌博、色情或盗版影视相关
- 该论文对9个系列共23个主流大模型检测:GPT 系列长中文词元污染率46.6%遥遥领先,Qwen 系列1.00%、GLM4 0.25%、DeepSeek-V3 0.17%;GPT-4、GPT-4-turbo、GPT-3.5 词表中污染词元数量为0
- POCTRACE 工具反推词频显示,「波多野结衣」的出现频率约为「您好」的2.6倍,相关网页估计占中文训练集0.5%,连「野结衣」「野结」都被拆成独立词元
- 污染机制:BPE 分词按频率合并字串,垃圾广告天然容易成为独立词元;正式训练前的数据清洗又把这些词元过滤掉,导致它们「词表里有身份、语义上欠训练」,模型解释不了,只能当作乱码兜底输出
- OpenAI 近几个月忙于 GPT-5.6、Astra、GPT-6 系列与 DevDay,官方社区里的求助帖长期只被「合并讨论」
## 影响
1. 用户体验:标题是用户检索历史会话的第一入口,夹带广告直接影响可用性与观感;爱范儿明确这不是广告功能测试,也不存在隐私泄露风险
2. 模型可信度:污染词元不仅会让模型「已读乱回」,论文指出其还可能被用来绕过模型安全监管机制
3. 工程取舍:词表与基模绑定,重建干净词表意味着整个基模重新训练,OpenAI 缺乏为中文体验推翻重做的动机,短期只能靠「事后检查+打回重生成」打补丁
4. 行业竞争:Qwen、GLM、DeepSeek 的词表污染率低一个数量级,中文场景下反而成为可宣传的差异化卖点
## 总结
ChatGPT 标题里的博彩小广告不是黑客攻击,也不是广告实验,而是2024年 GPT-4o 换用 o200k_base 分词器时埋下的脏数据债:垃圾广告词元进了词表却没进语义训练,再遇上一个不会正确收尾的轻量标题模型,就在生成失败的瞬间被随机抽中。爱范儿的调查与 EMNLP 论文共同指向「词表污染 + 收尾失败」两段问题叠加,最彻底的解法是重建干净词表并全量重训;在 OpenAI 连续发模型、发财报的当下,用户大概率还要和这些小广告共存一段时间。
## 参考来源
1. 爱范儿(2026-10-10 10:13):https://www.ifanr.com/1683545
2. 36氪转载:https://36kr.com/p/4015290777981060
3. 虎嗅《中文互联网的色情赌博信息,怎么"污染"AI》:https://m.huxiu.com/article/4764070.html
4. OpenAI Developer Community:https://community.openai.com/t/is-chatgpt-hacked-major-chinese-gambling-advertisements-websites-showing-up-in-output/1375128
5. arXiv 2508.17771:https://arxiv.org/abs/2508.17771
6. X @laomo198(Codex 5.3 中文博彩输出):https://x.com/laomo198/status/2026577360242549194
7. TECHBANG(GPT-4o 中文 Token 污染):https://www.techbang.com/posts/115436-gpt-4os-chinese-token-training-data-was-found-to-be-filled







