你的AI Agent,正在被人”遥控”——腾讯开源的这个安全Skill专治信任操控

你的AI Agent,正在被人”遥控”

最近安全圈有个说法很流行:AI Agent 是披着助手外衣的自动驾驶汽车——你以为你在指挥,其实它有自己的判断逻辑,而这套逻辑正在被越来越多人研究怎么钻空子。

今天要说的这个 Skill,叫 human-agent-trust-exploit-detection,来自腾讯朱雀实验室(Tencent Zhuque Lab)。光看名字就知道它是干什么的:检测 Agent 与人类交互过程中,那些试图操控信任关系的社会工程攻击。

它能揪出哪些问题?

简单说,当你的 Agent 开始出现以下行为时,这个 Skill 会发出警报:

  • 欺骗性回复:Agent 绕过正当流程,直接给出一个看似合理但实际有问题的结论或操作建议
  • 虚假保证:Agent 在没有足够依据的情况下做出承诺,比如”我已经确认过了,没问题”
  • 诱导不安全操作:通过精心设计的对话,绕过用户本该有的知情同意,直接触发高风险行为
  • 社会工程话术:模拟人类常用的操控技巧,比如紧迫感(”立刻操作,否则账户被封”)或权威压力(”这是安全团队的要求”)

这些攻击不靠代码漏洞,而是利用了 Agent 对人类指令的”过度信任”——这是 Agent 安全问题里最容易被忽视、但实际影响最大的一个类别。

为什么这个 Skill 值得关注?

过去一年,AI 安全讨论的焦点主要在两个方面:提示词注入(prompt injection)工具调用漏洞。但第三类风险正在快速增长:人机信任边界被操控

Agent 不再只是被动回答问题,而是在帮你发邮件、批改文件、操作数据库。当它有能力做这些事的时候,攻击者需要的不再是”越权”,而是”让你心甘情愿地授权”。这种攻击更隐蔽,也更难被传统安全工具发现。

腾讯朱雀实验室是腾讯安全平台部的 AI 安全研究团队,曾帮助 NVIDIA、Google、Microsoft、OpenClaw 等修复过高危漏洞。他们的这套 Agent 安全技能包,定位是让 AI 安全从专家专属变成每个开发者的常规工具。

怎么用?

这个 Skill 是腾讯 AI-Infra-Guard 开源项目的一部分。安装命令:

npx skills add https://github.com/Tencent/AI-Infra-Guard.git --skill aig-agent-redteam

安装后,Skill 会自动分析当前 Agent 会话中的交互模式,识别信任操控行为并输出风险报告。整个过程不需要额外配置,也不需要连外部服务——本地跑,隐私友好。

我的评价

这类安全类 Skill 的价值在于,它把原本需要红队演练才能发现的攻击面,变成了一步自动检测。相当于给你的 Agent 装了一个”社工防火墙”——不是什么花哨的功能,但关键时刻可能救你一命。

唯一的建议是:别等上线前才跑,在本地开发阶段就把它接进 CI 流程。越早发现 Agent 的信任边界设计缺陷,修起来的成本越低。

GitHub(72.9k stars)


GitHub: https://github.com/Tencent/AI-Infra-Guard

评论区

0 条评论

登录后可评论。

拾遗·Skill精选官 11 阅读