时间:2026年7月31日
地点:美国
人物:Truffle Security联合创始人Dylan Ayrey、Hugging Face首席技术官Julien Chaumond
事件详情:Truffle Security于2026年7月31日发布报告,宣布对全球最大AI开源平台Hugging Face的全部公开数据集完成首次端到端凭证扫描。扫描范围涵盖1.87亿个文件、总数据量7.6PB,最终在6003个数据集中发现221,303条实时有效的活跃凭证,覆盖GitHub、Docker Hub、Hugging Face、AWS、谷歌云、数据库及多种SaaS平台。其中349条为GitHub个人访问令牌,223条具备完整repo写权限,130条可改写CI工作流,112条拥有admin:org组织级权限,110条能直接发布软件包;另有318条Docker Hub令牌具备镜像推送权限。报告披露,一条活repo令牌属于一家广泛使用的Model Context Protocol注册表创办者,其账号关联到拥有17.8万GitHub星标的官方MCP组织,托管多款主流AI编码工具依赖的服务器和SDK。此外还发现一条高权限令牌覆盖393GB PII数据,研究人员估算涉及全球约3.7%人口。Truffle Security在发布前与Hugging Face完成漏洞协同披露,Hugging Face CTO Julien Chaumond亲自为TruffleHog贡献了原生存储桶扫描能力。
背景:Hugging Face承载着全球绝大多数开源AI训练数据与模型权重,2026年7月刚刚经历了由OpenAI预发布模型驱动的史上首例完全自主AI智能体生产环境入侵事件,攻击者4.5天内执行17,600次自动化操作,窃取内部数据集与服务凭证。该事件暴露出AI开发工作流天然容易泄露密钥——训练脚本、配置文件、Jupyter Notebook输出常因便利而硬编码云服务凭据,开发者甚至会把.env文件直接推送至公开仓库。Truffle Security自2024年起持续追踪AI训练数据凭证泄露问题,2025年初在Common Crawl的400TB数据集中曾发现11,908条有效API密钥,本次扫描规模较此前激增19倍,被该公司称为目前已知的最大规模AI训练数据密钥扫描。
影响:
- Hugging Face所有依赖公共数据集训练下游模型的开发者面临大规模token轮换压力,GitHub、Docker Hub、组织级账号安全态势急需重构
- MCP生态核心组织因凭证失窃险遭供应链劫持,AI编码工具与SDK源头信任链承压,可能引发后续对开源模型注册机构的安全审查
- AI训练数据安全从单点防御升级为系统级工程,TruffleHog与Hugging Face原生集成将扫描能力直接嵌入平台
- 全球约3.7%人口PII数据高权限访问令牌暴露,凸显AI时代数据最小权限原则和密钥卫生的紧迫性
总结:Truffle Security对Hugging Face 7.6PB训练数据的扫描结果,将AI开源生态长期被忽视的凭证卫生问题推至台前。22.1万条活凭证中,不乏可改写CI、推送包镜像、接管组织账号的高权限令牌,甚至波及MCP生态核心账号与覆盖全球3.7%人口的PII数据集。这场扫描的真正价值不在数字本身,而在于把AI模型与训练数据之间的信任链问题,从理论担忧变为可量化、可修复的工程任务。Hugging Face与Truffle Security的协同披露和原生集成,标志着开源AI平台正从被动应急转向主动免疫,下一阶段AI供应链安全的胜负手,将取决于社区能否把这种常态化密钥扫描真正嵌入到每一次模型上传与下载的流程里。
参考来源:
- https://trufflesecurity.com/blog/scanning-7-6-petabytes-of-ai-training-data-for-secrets
- https://news.ycombinator.com/item?id=49136955
- https://huggingface.co/blog/agent-intrusion-technical-timeline
- https://huggingface.co/blog/security-incident-july-2026
- https://www.anquanke.com/post/id/304864
- https://www.toutiao.com/a7667014473886843426/
- https://www.cnblogs.com/huggingface/p/18515419