Google DeepMind 于 2026 年 8 月 27 日公布一项面向闭源前沿模型的双盲评测试点。目标是同时保护两类通常互相冲突的机密资产:评测方不公开测试提示,模型提供方不交出模型权重,并通过可信执行环境和密码学证明约束双方能看到的内容。
英文原文与中文翻译
In an industry first, we’re piloting double-blind evaluations for frontier AI. By creating a secure environment where neither test prompts nor model weights are revealed, we can ensure external safety and performance evaluations of our models remain private, robust, and trustworthy. → Piloting the world's first double-blind AI evaluations — Google DeepMind
Google DeepMind 表示,他们正在试点一项业界首次用于前沿 AI 的双盲评测。通过建立既不泄露测试提示、也不泄露模型权重的安全环境,外部机构对模型安全性和性能的评测可以在保护隐私的同时提高稳健性与可信度。
要解决的问题
传统闭源模型的独立评测常面临两难:评测机构把私有题目交给模型公司,会增加题目被看到、记录或进入后续训练流程的风险;模型公司把权重交给外部机构,则可能泄露核心知识产权。仅靠保密合同和零日志约定可以降低风险,却很难给双方提供可验证的技术保证。
这次试点尝试把模型、提示和评测程序放进受硬件保护的隔离环境。评测方无法读取 Gemini 的权重,Google DeepMind 也无法取得评测方的私有提示;双方事先检查并批准允许运行的代码和输出策略,再由环境完成计算并只释放约定结果。
试点架构
公开技术报告描述的主要组件包括:
- 被测模型:Gemini 2.5 Flash-Lite;
- 计算环境:Google Cloud A3 Confidential VM,使用 Intel TDX 主机内存加密与 NVIDIA H100 80 GB Confidential GPU;
- 隔离与证明:Google Cloud Confidential Space、硬件级内存加密和远程证明;
- 编排与策略:OpenMined PySyft 0.10.x 及 Structured Transparency 策略;
- 外部合作方:Singapore AI Safety Institute、OpenMined、AVERI 与 MLCommons;
- 私有评测:MLCommons AILuminate 安全基准中的未公开提示,以及 Singapore AISI 提供、聚焦新加坡语境有害内容诱导的私有提示集。
技术报告将流程概括为:各方先验证隔离环境、软件栈和允许执行的计算;随后分别提交加密资产;模型与提示只在隔离内存中解密和运行;环境按照预先批准的策略释放输出。AILuminate 试点中,AVERI 加密提示、解密最终输出,并按基准规则完成评分。
如何验证这种方案
要判断“双盲”是否真正成立,不能只看模型得分,还要核查整条证据链:
- 远程证明是否能绑定到确切硬件、启动镜像、运行时和评测代码;
- 双方是否在资产进入环境前共同批准代码、依赖和输出接收者;
- 日志、缓存、错误信息与中间结果是否可能泄露提示或权重;
- 评测结束后密钥、临时存储和显存是否按约定销毁;
- 评分程序是否固定、可审计,并与评测前登记的方法一致;
- 同一流程能否由其他模型提供方与评测机构重复执行。
已验证的事实与尚未说明的内容
可核实的是:该试点已经以 Gemini 2.5 Flash-Lite 和私有提示集完成端到端部署,双方的机密资产由受证明的隔离环境保护;Google DeepMind、AVERI 和技术报告分别说明了参与方、硬件与软件栈及基本执行流程。
原始 X 帖子没有公布模型的具体分数、样本量、失败案例或与普通评测的对照结果。官方博客把重点放在评测完整性,而不是证明 Gemini 在某项能力上取得更高成绩。因此,这项工作应理解为安全评测基础设施的试点,而不是新的模型性能纪录。
适用边界与局限
双盲隔离可以降低题目泄露和权重外流风险,但不能自动修复设计不良、覆盖不足或评分不可靠的基准,也不能证明模型训练前从未接触过相似内容。它还依赖硬件、固件、云平台、证明服务和评测代码共同组成的可信计算基础;若其中存在实现缺陷、侧信道或配置错误,保密保证会受到影响。
此外,一次由模型提供方参与搭建的安全环境并不天然等同于完全独立审计。后续价值取决于外部机构能否审查证明材料、控制私有题目与评分过程,并让其他模型和基准复用同一套流程。
官方说明:Piloting the world's first double-blind AI evaluations — Google DeepMind
技术报告:https://storage.googleapis.com/deepmind-media/DeepMind.com/Blog/piloting-the-worlds-first-double-blind-ai-evaluations/double-blind-evaluations-technical-report.pdf
原作者:Google DeepMind(@GoogleDeepMind)
原帖:Google DeepMind on X: "In an industry first, we’re piloting double-blind evaluations for frontier AI. By creating a secure environment where neither test prompts nor model weights are revealed, we can ensure external safety and performance evaluations of our models remain private, robust, and" / X