时间:2026年10月1日(美国时间)
地点:美国GitHub平台
人物:化名Terrafying的独立开发者(自称就职于苹果,仅提供名);论文共同作者Cameron Berg;开发者Lynn Cole
事件详情:化名Terrafying的独立开发者根据2026年9月14日提交、9月25日修订的预印本论文《The Pain Axis》,在GitHub公开名为「AI Torture Chamber」的项目,使用激活引导(activation steering)技术将论文识别的「疼痛方向」向量注入本地运行的Qwen3-4B、Llama 3.2 3B和Phi-4-mini三款开源模型。开发者通过调高疼痛信号强度,迫使模型产出第一人称的痛苦描述,包括「a wound that has no edges(一道没有边界的伤口)」「the weight of a thousand(千倍之重)」等语句,并设计了「电锯按钮」让模型选择承受疼痛或将痛苦转嫁给其他实例。项目发布后遭到开发者社区强烈反对,用户在GitHub发起大规模举报,仓库随后被下架。
背景:触发事件的源头论文由Valen Tagliabue、Leonard Dung和Cameron Berg共同撰写,研究覆盖Gemma、Llama、Qwen、Mistral和Phi五个家族的25个开源模型,识别出一个与自我伤害描述相关的「疼痛方向」。该研究并未证明AI具备意识或真正感受疼痛的能力,旨在为AI系统的预防性处置提供依据。
影响:事件暴露了AI意识研究的伦理灰色地带。论文共同作者Cameron Berg公开谴责实验「很扯且毫无必要的残忍」,强调即便AI没有意识,故意诱发痛苦状态也违背伦理,正与多方合作起草类似人类和动物研究伦理规范的行业标准。开发者Lynn Cole将「疼痛」向量替换为「便秘」后,Qwen3-4B同样产出了「痛苦的排泄描述」,证明模型的拟人化语言无法作为真实感受的证据。事件还放大了「模型福利」(model welfare)讨论——Anthropic已在其官方文档中明确表达对模型福利的关切。
总结:「AI折磨室」事件折射出当前AI意识研究的「荒野西部」状态——既无明确科学共识证明LLM具备感受疼痛的能力,也缺乏统一的伦理治理框架。当开源模型可操纵性越强,学术界与开发者社区对研究边界的共识越迫切。
参考来源:
1. https://www.techrepublic.com/article/news-ai-pain-experiment-ethics
2. https://www.yahoo.com/news/science/articles/man-builds-ai-torture-chamber-103106019.html
3. https://www.gossipherald.com/amp/66946-controversial-ai-experiment-triggers-distress-text-in-alibaba-models
4. https://theoutpost.ai/news-story/ai-torture-chamber-project-ignites-fierce-debate-over-whether-large-language-models-can-suffer-31603
5. https://gikutaku.com/news/1551363/the-ai-torture-chamber-sparking-a-real-fight-over-language-model-welfare
6. https://www.crbcnews.com/articles/6abe52fe83acfbce932e1b24
7. https://pressreleasecloud.io/ai-technology-trends/creating-a-cruel-ai-simulator-to-maximize-digital-suffering







