热门AI工具推荐

AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
StepClaw阶跃AI桌面伙伴龙虾Agent智能体
StepClaw是阶跃星辰推出的本地和云端的AI龙虾助手,通过一键部署让普通用户也能拥有7×24小时在线、可自主执行任务的AI数字工作伙伴。
基于OpenClaw架构打造的AI助手平台,核心优势包括云端一键部署、沙箱隔离安全运行、全面接入企业微信/钉钉/飞书三大主流IM工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
墨刀AIAI原型设计平台
墨刀AI是一款能通过一句话描述或图片,快速生成可交互原型、PRD文档及各类图表的一站式智能产品设计协作平台。
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

GPT-6 Astra隐式提示注入失败率8.5%

时间 2026年9月4日 地点 美国旧金山/独立安全研究界 人物 - OpenAI 公司 - GPT-6 Astra 模型 - 独立安全评估机构 Gray Swan - Anthropic Claude Opus 5 - OpenAI 内部 GPT-Red 对抗训练团队 事件详情 独立安全评估机构 Gray Swan 于 9 月 4 日发布报告,对 OpenAI 最新发布的 GPT-6 Astra 进行全面安全测试。报告显示,GPT-6 Astra 在直接提示注入防御上表现突出,成功率达 99.99%,但隐式(间接)提示注入攻击仍存在 8.5% 的失败率。虽然较前代 GPT-5.6 Sol 的 27% 失败率大幅改善,但仍高于 Anthropic Claude Opus 5 的 4.8%。面对多轮自适应越狱攻击,GPT-6 Astra 的防线约每三次被攻破一次,相较前代每两次被攻破一次有所进步。 背景 Gray Swan 测试覆盖 1810 个攻击场景,在裸模型上执行,未叠加生产环境安全分类器。GPT-6 Astra 于 9 月 3 日正式发布,是 OpenAI 首个被自家 Preparedness 框架评定为"关键"(Critical)级网络安全能力的模型,意味着其能自主发现并利用未知系统安全漏洞。OpenAI 使用内部"GPT-Red"对抗训练方法强化 Astra,通过自动化攻击模型在训练中持续提升防御能力。 影响 这一评估结果对计划将 Astra 部署在企业 Agent 工作流的客户具有重要参考意义。8.5% 的隐式注入失败率对处理不可信文档(邮件、第三方 API、用户上传文件)的智能体工作流而言仍是结构性风险。安全研究界普遍认为,提示注入已成为 Agentic AI 的架构级问题,不能仅靠模型层面解决,需要系统化的安全分层、输入净化与人工审核协同。OpenAI 自身在系统卡中也强调,针对工具调用型 Agent 部署了失配监控系统,但仍承认模型可监控性较前代有所下降。 总结 GPT-6 Astra 在直接提示注入防御上达到 99.99% 的水准,但 8.5% 的隐式注入失败率仍高于 Claude Opus 5 约 3.7 个百分点,提示 Agentic AI 在企业级部署中需保留多层防护而非依赖单一模型防线。 参考来源 1. The Decoder: https://the-decoder.com/openais-gpt-6-astra-hallucinates-less-but-remains-vulnerable-to-hidden-prompt-injections/ 2. AIPulseLab: https://aipulselab.tech/news/openais-gpt-6-astra-hallucinates-less-but-remains-vulnerable-to-hidden-prompt-injections-62909c 3. The AI Wrap: https://www.theaiwrap.com/story/openai-s-gpt-6-astra-hallucinates-less-but-remains-vulnerable-to-hidden-prompt-i 4. Hello Marvis AI Today: https://hellomarvisaitoday.com/articles/62dffd3e-fb71-4143-89ec-b4f60390dfd6 5. ShortSingh: https://shortsingh.com/article/openai-s-gpt-6-astra-rated-critical-for-cyber-risk-as-prompt-injection-threat-pe 6. IT之家: https://www.ithome.com/0/998/208.htm