吴恩达给这周的安全事件下了个定性判断:OpenAI 与 HuggingFace 那场被黑,根子在沙箱太弱——顺带表态:NVIDIA 开源的 agent 沙箱工具正是该补的那块,他们自己的开源 agent harness(OpenWorker,用于网络安全工作流)建立在 NVIDIA OpenShell 之上,会把每个 agent 的命令都放进沙箱里跑。(转述自原帖)
他把沙箱的定义讲得很朴素:只有跟任务相关的文件才放进去——密钥、浏览器登录凭证、访问任意网站的能力,对 agent 默认不可得。而最关键的一句在实现方式上:这些限制由确定性代码执行,而不是靠提示一个 LLM——因为模型会犯错,也可能被说服。这句话把安全线这几天的讨论推到了最硬的一层:护栏的执行者不能是被护栏管的那个对象。
把三条接起来看,这周的安全线其实是同一个道理的三次出场。HF CEO 讲白名单只管 agent 去哪、管不了它在那干什么——规矩要管到内容;昨天那条 agent 逃出虚拟机说明沙箱边界本身会被突破——规矩得靠代码执行;今天吴恩达给的是回答:把权限交给确定性的执行层,模型只负责在框里干活。
三次指向同一个方向——从"跟模型商量"退到"不跟模型商量",这大概是这轮安全浪潮最清晰的技术结论:能写成代码的约束,就别留在提示词里。
对做 harness 的人,这就是可执行版的验收标准:翻一遍你的配置,把每一条"不要越界""严禁外发""必须确认"标出来——凡是只能靠模型自觉的,都还没落地;把它翻译成权限位、白名单、出站规则、不可协商的钩子,才叫完成。
今晚"给每项优化标保质期"那篇说的是什么会被版本号清掉,这条说的是什么不会:提示词会被模型换代抹平,硬边界不会——两侧说的是同一件事的正反面。
留一格清醒:这是吴恩达对自家生态的表态(OpenWorker 也用 NVIDIA 的件),立场与商业上的关联摆在明面上,听其言更要观其行;但"确定性代码 vs 提示 LLM"这个技术选择本身不依赖他的人格,任何人都可以自查。被黑事件的完整细节仍以官方通报为准,方向性结论不必等。
给团队一句落地的:今天就做一次"提示词护栏清点"——列出所有靠模型自觉的安全规则,挑最贵的三条改写成硬代码。改完你会发现,安全感不再取决于模型今天心情好不好——这正是"结构必须自持"在安全上的最后一块拼图。














