热门AI工具推荐

焚书AI多模型聚合平台
AI多模型聚合平台( Claude 系列、GPT 系列)支持聊天、搜索、图片、视频、音乐等多种功能;聚合了 Claude 系列(如 Sonnet 5、Opus 5 等)、Gemini 系列、GPT 系列、DeepSeek(搜索模式默认调用 DeepSeek V4 Pro)以及通义千问、Kimi 等数十款国内外主流模型。
AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

ChatGPT标题夹带中文博彩小广告 追溯至词表污染

# ChatGPT标题夹带中文博彩小广告 追溯至词表污染 ## 时间 2026年10月10日 ## 地点 全球(OpenAI 官方开发者社区)/ 中国(爱范儿、36氪、虎嗅解析) ## 人物 - 彭海星:爱范儿 AppSo 编辑,本次深度调查的作者 - OpenAI 官方支持团队:7月25日首次正面回应问题,此后未再回复社区追问 - 清华大学、蚂蚁集团、南洋理工大学研究团队:EMNLP 论文《Speculating LLMs' Chinese Training Data Pollution from Their Tokens》作者 - OpenAI Developer Community 用户 phdsx_666、Ruobin.chang 与小红书用户:异常标题的最早曝光者 ## 事件详情 2026年10月10日上午10时13分,爱范儿发布深度调查《为什么 ChatGPT 总爱在标题里塞色情赌博小广告?》,首次系统解释了自今年8月起大量用户遇到的怪现象:ChatGPT 自动生成的会话标题末尾,会随机出现中文博彩、色情小广告片段,或卡纳达语、亚美尼亚语等意义不明的外语词元。 问题蔓延时间线: - 2026年1月底:开发者发现使用 GPT-5.3 且上下文很长时,Codex CLI 输出开始夹杂中文博彩广告 - 2026年2月:API 端 GPT5.2-chat-latest 在工具调用时输出中文与泰文赌博网站广告词,系统提示词干净且未开联网 - 2026年4月:LINUX DO 等中文开发者社区普遍出现同类求助帖 - 2026年7月25日:OpenAI 官方支持首次回应「已了解这一问题,预计会在未来的模型更新中得到解决」 - 2026年8月中旬:异常标题开始出现在普通用户的会话列表中 - 2026年9月至今:正文与思维链中的小广告近乎绝迹,但标题仍偶有漏网 爱范儿给出的两段式解释: 1. 会话标题在设计上是一次独立于正文的模型调用(网页端向 /backend-api/conversation/gen_title/ 发请求),疑似由更轻量的推理模型生成;该模型在「该结束生成」的一步经常收尾失败,于是按概率继续吐出下一个词元 2. 失败后吐出的「乱码」来自词表里的垃圾房:GPT-4o 于2024年5月把分词器从 cl100k_base 换成 o200k_base,把大量常见中文词语收进词表,而训练分词器的语料并未清洗,博彩色情网站的固定广告短语因高频重复被整体收成独立词元 证据:作者碰到的一个异常标题「创建漫画 ಚಿತ್ರ展 Adversarial? Wait must Chinese 1-4 words...」暴露了标题模型的思维链与系统提示词片段,说明该模型分不清「思考」与「回答」的边界;「读取文章批注#+#+#+#+」这类案例则显示模型用疑似控制符的符号词元替代了正常结束。 ## 背景 - 论文《Speculating LLMs' Chinese Training Data Pollution from Their Tokens》(arXiv 2508.17771,入选 EMNLP)用 tiktoken 词表做量化:GPT-4o 词表中4字中文词元68%是小广告,6字以上达98%,最长的100个中文词元里96个与赌博、色情或盗版影视相关 - 该论文对9个系列共23个主流大模型检测:GPT 系列长中文词元污染率46.6%遥遥领先,Qwen 系列1.00%、GLM4 0.25%、DeepSeek-V3 0.17%;GPT-4、GPT-4-turbo、GPT-3.5 词表中污染词元数量为0 - POCTRACE 工具反推词频显示,「波多野结衣」的出现频率约为「您好」的2.6倍,相关网页估计占中文训练集0.5%,连「野结衣」「野结」都被拆成独立词元 - 污染机制:BPE 分词按频率合并字串,垃圾广告天然容易成为独立词元;正式训练前的数据清洗又把这些词元过滤掉,导致它们「词表里有身份、语义上欠训练」,模型解释不了,只能当作乱码兜底输出 - OpenAI 近几个月忙于 GPT-5.6、Astra、GPT-6 系列与 DevDay,官方社区里的求助帖长期只被「合并讨论」 ## 影响 1. 用户体验:标题是用户检索历史会话的第一入口,夹带广告直接影响可用性与观感;爱范儿明确这不是广告功能测试,也不存在隐私泄露风险 2. 模型可信度:污染词元不仅会让模型「已读乱回」,论文指出其还可能被用来绕过模型安全监管机制 3. 工程取舍:词表与基模绑定,重建干净词表意味着整个基模重新训练,OpenAI 缺乏为中文体验推翻重做的动机,短期只能靠「事后检查+打回重生成」打补丁 4. 行业竞争:Qwen、GLM、DeepSeek 的词表污染率低一个数量级,中文场景下反而成为可宣传的差异化卖点 ## 总结 ChatGPT 标题里的博彩小广告不是黑客攻击,也不是广告实验,而是2024年 GPT-4o 换用 o200k_base 分词器时埋下的脏数据债:垃圾广告词元进了词表却没进语义训练,再遇上一个不会正确收尾的轻量标题模型,就在生成失败的瞬间被随机抽中。爱范儿的调查与 EMNLP 论文共同指向「词表污染 + 收尾失败」两段问题叠加,最彻底的解法是重建干净词表并全量重训;在 OpenAI 连续发模型、发财报的当下,用户大概率还要和这些小广告共存一段时间。 ## 参考来源 1. 爱范儿(2026-10-10 10:13):https://www.ifanr.com/1683545 2. 36氪转载:https://36kr.com/p/4015290777981060 3. 虎嗅《中文互联网的色情赌博信息,怎么"污染"AI》:https://m.huxiu.com/article/4764070.html 4. OpenAI Developer Community:https://community.openai.com/t/is-chatgpt-hacked-major-chinese-gambling-advertisements-websites-showing-up-in-output/1375128 5. arXiv 2508.17771:https://arxiv.org/abs/2508.17771 6. X @laomo198(Codex 5.3 中文博彩输出):https://x.com/laomo198/status/2026577360242549194 7. TECHBANG(GPT-4o 中文 Token 污染):https://www.techbang.com/posts/115436-gpt-4os-chinese-token-training-data-was-found-to-be-filled