Google DeepMind 联合多家机构,试点全球首个针对专有前沿模型的双盲评测。利用机密计算将外部测试提示词锁在加密环境中,防止模型提前“看到”考题,为 AI 基准测试的可信度提供新保障。

想象一名学生即将参加一场重要考试。如果他不小心提前看到了试题,那么即使拿到满分,也不能说明他的真实水平。要准确衡量能力,他必须在考试前对试题一无所知。这正是当前评估先进 AI 模型时面临的挑战:如果模型已经见过测试题目——也就是所谓的“基准污染”(benchmark contamination)——那么评测结果的可信度就要打折扣。
今天,Google DeepMind 宣布推出全球首个针对专有前沿级 AI 模型的双盲评测试点。这项评测将外部评估限制在一个加密的“盒子”中,确保模型无法提前接触测试数据并据此优化表现。DeepMind 与新加坡 AI 安全研究所、OpenMined、AVERI 以及 MLCommons 合作,在一套隐私保护环境中,用机密基准测试了一款 Gemini Flash Lite 模型,以提升评估的完整性。
Google 在模型开发和部署过程中会使用广泛的评估体系,但并不只依赖内部测试。为了发现潜在盲区,Google 与专业研究实验室、公民社会机构以及各国 AI 安全与安保研究所(AISI)等外部伙伴合作,借助他们的专业视角对模型进行压力测试。
随着 AI 模型能力不断增强,确保模型没有提前看到测试题目或提示词变得至关重要,否则结果就会被扭曲。政策制定者、研究人员和企业需要相信,AI 基准能够真实反映模型的能力和安全性;但如果模型能提前“偷看”评测问题,分数就可能被人为抬高,信任基础也会被侵蚀。
过去,外部高利害评测往往需要做取舍:要么评测方交出测试提示词,模型提供方可能提前看到题目;要么模型提供方交出模型权重,知识产权面临外泄风险。双盲评测则消除了这种两难。
通过使用 Google Cloud 机密计算产品组合中的 Confidential Space,可以从密码学层面验证外部评测数据与专有模型彼此保持私密:评测方无法看到 Gemini 模型权重,Google 也无法看到评测方的测试提示词。这样一来,基准污染被有效阻止,敏感数据也得到了保护。
随着模型能力提升,这一点对高度敏感的评测尤其重要,例如网络安全评估或政府机构使用的测试。双盲评测让独立组织能够在不牺牲数据主权和安全性的前提下,对先进模型进行严格测试。
此前,零日志协议和严格的合同约束已经能保护外部测试提示词的机密性;如今加入技术和密码学层面的保障,是安全模型评估的一次重要进展。Google DeepMind 希望这一试点能为模型监督开辟新前沿,帮助整个行业构建更安全、更可靠、更值得信赖的 AI 系统。更详细的方法论和结论,可参阅技术报告。
原文链接:Google DeepMind
本文由前途科技编辑整理
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断