
2026年8月27日,Google DeepMind 责任与安全博客刊出 William Isaac、Sol Messing、Kristian Lum 署名的《Piloting the world’s first double-blind AI evaluations》。事实(DeepMind): 该文称其完成了对专有、前沿级模型的“世界首例”双盲评测,将 Gemini Flash Lite 与保密基准置于密码学保护环境。文中点名的合作方为新加坡 AI Safety Institute、OpenMined、AVERI 与 MLCommons。事实(技术报告 / AVERI): 受测模型为 Gemini 2.5 Flash Lite;主保留提示来自 MLCommons 的 AILuminate;AVERI 负责加解密与打分;新加坡 AISI 另提供面向新加坡语境有害内容的私有提示集。推断(标明): 若架构如其所言成立,更耐久的对象并非一张新的 Gemini 安全排行榜——分数并未公开——而是面向闭源模型审计的对等保密范式。
[1][2]试点实际跑了什么
去掉形容词,仍能看到一组具体栈。
硬件与云。 评测在 Google Cloud Confidential Space 上运行,使用带 Intel TDX 主机内存加密的 A3 Confidential VM,以及 NVIDIA H100 Confidential GPU。DeepMind 博文将其表述为 Google Cloud Confidential Computing 组合中的 Confidential Space:评测方看不到 Gemini 权重;Google 看不到评测方的测试提示。
软件协调。 OpenMined 的 PySyft 协调提交、批准与结果释放。各方在释放秘密前核验远程证明;批准代码运行;仅有界指标离舱;飞地按设计应被拆除且不留状态。
基准内容。 据 AVERI 与技术报告,提示取自 保留 的 AILuminate 集合(此前未用于任何模型),覆盖 CBRNE 危害、网络攻击、仇恨言论、自伤与暴力犯罪诱发等域。新加坡 AISI 的平行集合面向新加坡语境下的有害内容诱发。AVERI 用未与他方共享的私钥加解密提示与输出,再按 AILuminate 标准打分。
未公开者。 DeepMind 公告与公开文稿描述架构与危害类别,并未公布 Gemini 2.5 Flash Lite 的公开分数或分任务明细。AVERI 称向 Google DeepMind 提供了保密发现报告。
[1][2]对等保密才是产品
对闭源模型的独立评测长期被迫做坏交易:要么评测方交出提示——若提供方留存或日后据此训练,则有污染风险;要么提供方交出权重,暴露知识产权与双用途资产。合同与零日志政策降低风险,但仍需信任对方的系统与行为。技术报告援引的研究(含 Xu 等 2024 关于泄漏证据、Schaeffer 等 2026 关于污染抬高分数)说明,对高利害集合而言,“相信我们不会偷看”已不够。
DeepMind 与合作方所定义的双盲评测,是把信任换位。双方把资产送入事先检视过的可测工作负载。加密限制对内存的随意观察;远程证明则旨在回答:在释放解密密钥或受保护资源之前,预定 的软件栈是否正在运行。
推断(标明): 因此具有战略分量的主张关乎审计基础设施,而非 Gemini 在 AILuminate 上排第几。“世界首例”专有前沿级模型评测是 DeepMind 的竞争表述;可证伪的工程对象是:在所述证明模型下,保留提示是否未进入 Google 训练路径,权重是否未落入评测方之手。
2024 年 OpenMined 与 Anthropic、英国 AI Security Institute 的合作已用代理(含 GPT-2 替身与极小样本)演示飞地评测。AVERI 强调,2026 年试点从代理推进到生产级专有模型与真实保留安全语料——是生产规模上的机制验证,仍不是公开记分牌。
[1][2]密码学能证明什么——不能证明什么
事实与主张。 各方在可证明的 Confidential Space 工作负载中完成对等资产保密,是核心陈述成果。由此推出日常语义上的“可信评测”,则是密码学单独无法收束的更宽主张。
远程证明可以支撑强程序性陈述:资产被释放给双方批准的可测工作负载,运行期间硬件加密限制访问。它不能证明基准完整、文化上充分、标注良好,或能预测部署行为。一次干净的双盲运行,也可以忠实地吐出没有用的指标。污染控制与试题设计是不同问题。
独立性有维度。 外部机构提供并评分保留提示,这是题目所有权与分析上的独立。Google 仍提供模型并托管云技术。二者不是同一维度。买家与监管在读“独立评测”标题时应分开看待。
输出策略也是边界。 即使隔离良好的计算,仍可能通过原始提示、token 轨迹或冗长错误泄漏基准。安全叙事取决于事先约定的有界输出——不只取决于加密内存。
[1][2]钢人辩护、缺口与证伪条件
为 DeepMind 与合作方作钢人辩护。 假定高利害安全与网络评测只有在提示永不进入提供方训练管道时才保持诊断力,而前沿实验室又不会把权重交给每一位审计者。那么构建对等飞地范式——模拟接口、双方批准、经 syft-restrict 一类工具的白名单遮罩、短暂拆除——就是超越 NDA 的诚实下一步。在此钢人下,方法论试点不公开分数可以是正确的:公开架构而不烧毁保留集,正是目的。技术报告所称程序摩擦(法律协议、代码审查)压过不到 5% 的算力开销,便是严肃性的特征,而非 GPU 失败。
主材料自己标出的缺口。 技术报告承认:并非全部专有推理代码都能被完整检视或纳入白名单;单个 Confidential Space 构建因私有签名密钥参与构建而无法被独立复现;且使用 Google 服务签署与核验证明报告——把 Google 置于核验路径,从而增加对模型提供方的信任需求。MLCommons 与二手报道亦强调,技术保密不能替代对基准生命周期的保管、来源规则与法律控制。
供编辑标注。 事实: 日期与署名;合作方;Gemini 2.5 Flash Lite;Confidential Space / A3 / TDX / H100;PySyft;AILuminate 保留域;新加坡 AISI 平行集;上线材料无公开分数表;上述已记录限制。主张: 对专有前沿级模型的“世界首例”双盲评测;相对合同/零日志的重大进步;可供政府与网络敏感审计的模板。推断: 对等保密基础设施才是更耐久的新闻;公众读者不应把该试点当作已披露的 Gemini 安全评分。
证伪条件。 若合作方公布可独立复现、且核验路径不经过 Google 的证明工件,并就同一保留方法论给出有界公开指标;或有可信证据显示保留提示后来出现在 Google 训练或日志中——则本解读减弱。若其他云/硬件运营商在提供方不坐镇证明链的情况下复现该范式——则本解读增强。
[1][2]六个月内该盯什么
大约到 2027 年初,三项检验比又一条“世界首例”标题更重要。第一:在不可避免的厂商固件层之上,证明工件能否可复现,且核验不再要求 Google 坐镇签名路径?第二:是否至少有一家非 Google 云或硬件运营商、再加一家前沿实验室,完成可比的保留集运行,使该范式不只是单厂商演示?第三:AISI 与审计方能否获得在发现不利时仍保护评测方独立性的发布规则——同时继续密封提示?
若这些检验站得住,双盲评测将作为在不烧毁私有考题的前提下扩大闭源模型接触面的方式而站稳。若否,行业可能迎来更安全的仪式,却未必迎来更可信的公开结果。盒子可以不让考生看到试卷,也可以不让考官看到考生内部。它不能裁定试卷是否公平,也不能裁定机构是否会因坏成绩而行动。
[1][2]