时间
2026年9月17日(北美时间周三)
地点
美国加利福尼亚州旧金山(Baseten总部)
人物
- Baseten:AI推理服务提供商,估值130亿美元
- Base Labs:Baseten今年新设的研究部门
- Hugging Face:全球最大开源AI模型托管平台
- Goodfire AI:AI模型可解释性初创公司,估值12.5亿美元
事件详情
AI推理服务商Baseten于9月17日宣布,旗下研究部门Base Labs与Hugging Face、Goodfire AI达成开源AI安全合作。三方将共建开源权重(open-weight)模型的安全评估与监控基础设施。Base Labs将负责开发并公开训练、监控开源模型的方法论,目标是把"安全"嵌入到模型的训练与部署流程中,而非作为附加件事后打补丁。Hugging Face作为全球最大的开源模型分发平台,将参与标准制定与潜在的分发管道集成;Goodfire AI将贡献其在模型可解释性领域的技术,让模型内部决策过程变得可观测。
背景
开源权重模型近年快速普及,但"消融护栏"(abliteration)滥用现象日益严重——通过技术手段可移除模型内置安全防护,使其绕过使用限制。Hugging Face当前已收录超过6,000个被"消融"过的模型。Baseten今年6月完成15亿美元F轮融资,估值达130亿美元;Goodfire AI此前完成1.5亿美元B轮(B Capital领投),估值12.5亿美元,专注模型可解释性研究,已与Arc Institute、梅奥诊所等机构合作识别阿尔茨海默病新生物标志物。
影响
- Hugging Face直接参与意味着任何新标准可直接对接全球最大开源模型分发管道,提升实际约束力
- Goodfire的"机制可解释性"技术为监控体系提供技术基础,可在模型运行时检测异常行为
- 此举是开源阵营对"消融护栏"乱象的正面回应,可能推动欧盟AI法案、美国行政命令框架下的自律治理
- Meta、Mistral等头部开源权重厂商是否跟进将决定该标准能否成为行业基线
总结
这是AI推理巨头Baseten联手模型分发龙头Hugging Face与可解释性新锐Goodfire,对开源模型"消融护栏"乱象作出的标志性回应。在6,000+被消融模型充斥Hugging Face的背景下,三方尝试将"安全"嵌入训练流程而非事后修补,为开源AI生态树立可复用的安全基线,也折射出行业从单家自律向联合治理的范式转移。
参考来源
- TechCrunch 报道:https://techcrunch.com/2026/09/17/base-labs-launches-an-open-weight-ai-safety-partnership-with-hugging-face-and-goodfire/
- The Meridiem 行业分析:https://www.themeridiem.com/ai/2026/09/17/ai-safety-shifts-to-industry-standards-as-base-labs-forms-consortium
- Scopeora 报道:https://www.scopeora.com/base-labs-hugging-face-and-goodfire-join-forces-for-open-ai-safety-standards-9206.html
- TechCrunch 消融护栏背景:https://techcrunch.com/2026/09/03/abliteration-ai-is-making-a-business-out-of-removing-ai-guardrails/
- TechCrunch Baseten F轮融资:https://techcrunch.com/2026/06/18/ai-inference-startup-baseten-reportedly-raising-1-5b-months-after-its-last-mega-round/
- Work-Bench Goodfire B轮融资:https://work-bench.com/post/goodfire-raises-150m-series-b-to-advance-the-frontier-of-ai-interpretability







