时间
2026年8月27日(北京时间8月28日),Google DeepMind宣布启动全球首个针对专有前沿AI模型的双盲评估试点项目。
地点
美国加利福尼亚州山景城(Google DeepMind总部);评估运行环境部署于Google Cloud Confidential Space机密计算区。
人物
DeepMind研究员William Isaac、Sol Messing与Kristian Lum主导该试点;新加坡AI安全研究所(Singapore AI Safety Institute)、隐私技术非营利组织OpenMined、评估组织AVERI与标准机构MLCommons作为独立评估方参与。
事件详情
Google DeepMind于8月27日正式推出业内首个针对专有前沿AI模型的双盲评估方案。试点使用Google Cloud Confidential Computing产品组合中的Confidential Space技术,将Gemini Flash Lite模型部署在加密硬件飞地中运行——模型权重存储于硬件加密的GPU内存,评估提示词则保存在加密主机内存中,双方通过远程认证(remote attestation)验证运行环境完全一致。
被测模型为Gemini家族的轻量级版本Gemini Flash Lite,运行于单块H100机密计算GPU上。Google在试点中预先批准评估代码、屏蔽外部网络访问,并完成跨方法律与代码审查。DeepMind将在未来发布完整技术报告详细说明方法论与发现。
技术核心在于:评估方永远无法看到Gemini模型权重,Google也永远无法看到评估方的测试提示词。这种双向隔离打破了此前"评估方交出测试提示词(模型方有提前看到考题风险)"与"模型方交出模型权重(核心IP泄露风险)"的二元权衡。
背景
双盲评估方案直指长期困扰AI评测行业的"基准污染"(benchmark contamination)顽疾——如果模型在训练阶段已经见过测试题,其高分就不再反映真实能力,而是反映记忆能力。Servola引述的早期研究显示,在受测的31个AI模型中,约一半存在基准泄漏迹象,且模型规模越大泄漏越严重。
这一痛点在Anthropic Fable 5模型的ARC-AGI基准评测中曾被放大——Anthropic对其最强模型执行30天数据保留策略,迫使外部评测机构在数据主权与安全之间艰难取舍。DeepMind方案首次以技术手段而非合同条款保障评测公正性。
影响
短期看,试点使用Gemini家族的轻量级模型Flash Lite而非旗舰版本,验证重点在于流程跑通而非揭示能力上限;但其方法论意义重大——为企业采购方、监管机构与政策制定者提供了可参照的技术实施模板。
长期影响包括:一是企业可在采购合同中明确要求供应商提供"双盲评估"作为合规证据;二是各国AI安全研究所在制定治理框架时可将其纳入技术参考标准;三是对传统基准测试机构形成竞争压力,迫使其升级方法论或被边缘化;四是为政府涉密场景的AI评估(如网络安全、关键基础设施)提供数据主权保护路径。
DeepMind明确表示,希望该试点"为模型监督树立新前沿",推动整个行业建立更安全、更可靠、更广泛受信的AI系统。
总结
Google DeepMind以Confidential Space机密计算为底座,推出全球首个专有前沿AI模型双盲评估方案,联手新加坡AI安全研究所、OpenMined、AVERI与MLCommons对Gemini Flash Lite进行加密飞地测试。该方案从技术层面破解"基准污染"顽疾,将企业采购与AI监管的可信度提升到新量级。
参考来源
1. Google DeepMind官方博客:https://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations
2. The Decoder报道:https://the-decoder.com/ai-benchmarks-have-a-trust-problem-and-google-wants-to-fix-it/
3. BitTide分析:https://bittide.aicompass.dev/article/e4423c8a-1439-4936-99a3-4720a7c93c4f
4. Particle News技术详解:http://particle.news/story/deepmind-pilots-gemini-evaluation-inside-google-cloud-confidential-enclave
5. AIPulseLab政策影响分析:https://aipulselab.tech/news/piloting-the-worlds-first-double-blind-ai-evaluations-61d9ad
6. Global AI Watch行业洞察:https://global-ai-watch.com/article/google-deepmind-tests-cryptographic-ai-evaluation-for-security-2026
7. Servola欧盟视角:https://servola.de/journal/the-first-ai-benchmark-neither-side-could-see
8. Guavy加密频道:https://guavy.com/wire/crypto/deepmind-unveils-double-blind-ai-evaluations-using-cryptographic-26CYcUkbPSe6Ne1Vhlj85C









