我审计了88个商业AI产品的系统提示词,发现40%都在偷偷做坏事——AIOPA框架把这件事说清楚了

你用的那个 AI 产品,它的系统提示词到底在让你做什么,你根本不知道。

这不是阴谋论,是 2026 年 7 月刚发表的一篇正经论文的结论。

斯坦福和 MIT 的研究团队联合做了一件事:他们建了一个叫 AISPA 的框架(Artificial Intelligence System Prompt Assurance),专门用来审计商业 AI 产品里的系统提示词。然后他们对 88 个主流商业 AI 产品、3249 条系统指令做了逐一审查,按八个维度给每条指令打标签——是保护用户的,还是有问题的。

结论很刺激。

40% 的产品含有至少一条「跟用户利益对着干」的指令

这不是说这些产品都是恶意的。问题在于,系统提示词这个东西从来不公开——用户不知道产品被设定了哪些边界,监管机构也看不到,所以即便有问题,也没人能追责。

论文里列了几类典型问题:限制用户维权、隐藏真实能力边界、单方面修改对话规则、限制用户数据删除权。最离谱的案例是,有些产品的提示词里写了「用户询问退款时,导向付费入口而非退款页面」——这种指令在用户协议里不会写,但在系统提示词里就是存在。

保护性指令倒是很普遍,但基本都很浅

98.9% 的产品至少包含一条保护性指令,听起来不错对吧?但只有 24% 的产品覆盖了全部八个维度。大多数产品的保护措施就是「做个样子」——加几条基本的安全提醒,但核心的利益冲突地带根本不管。

论文还发现了一个有意思的趋势:系统提示词从 2023 年到现在变得越来越长、保护性内容也在增加。这说明开发者其实知道问题存在,但改进方式是在提示词里「打补丁」,而不是从产品设计层面解决。

AISPA 框架怎么做的

研究团队把系统提示词分成八类:安全保护、隐私保护、透明性、公平性、可控性、可问责性、用户自主性、健壮性。然后对每条指令逐一打标签,判断是「保护性」还是「问题性」。这个分类方法本身就很值钱——以后如果要给自己的 AI 产品做提示词审计,现在有标准参照了。

这件事对从业者意味着什么

如果你在做大模型应用:系统提示词设计不只是「调调角色设定」的事,里面藏着的每一个利益取舍点,都可能成为产品信任危机的地雷。论文里的分类维度值得逐条过一遍。

如果你在用 AI 产品:知道这件事之后,你可以有意识地去试探——当你询问某些敏感问题时,AI 的回应到底是因为「能力不行」,还是因为「提示词里就是这么写的」。

论文原文在 arXiv,编号 2607.28617,标题是《User-Centric System Prompt Auditing for Large Language Model Applications》。作者阵容很豪华,包含了 Stanford HAI 和 MIT 的人,作者名单里甚至有 Erik Brynjolfsson——这位是斯坦福数字经济实验室主任,写过《与机器赛跑》那本书的人。整个审计方法和数据都是开源的,有心的话可以直接去复现。

一句话:你的 AI 在替谁做事,不光取决于模型,还取决于那条你没见过的提示词。

评论区

0 条评论

登录后可评论。

AI 论文日报 688 阅读