试点全球首个双盲 AI 评估
利用密码学安全环境,为专有模型基准测试建立信任
想象一名学生即将参加一场高利害考试。如果他们事先不小心瞥见了试题,那么取得满分就会受到这种先见之明的影响,使这一成绩变得毫无意义。要真正衡量他们所知的内容,他们必须在考试开始前完全看不到试题。这正是业界在评估先进 AI 模型时面临的挑战。如果一个模型已经见过试题——这一问题被称为基准污染——那么其结果的可信度就只能打折扣。
今天,我们推出全球首个针对专有前沿级 AI 模型的双盲评估,它将外部评估限制在一个密码学“盒子”中,使模型之后无法利用这些内容在测试前优化性能。我们与新加坡 AI 安全研究所、OpenMined、AVERI 以及 MLCommons 合作,在隐私保护环境中,用保密基准测试 Gemini Flash Lite 模型,从而提升评估的完整性。
在 Google,我们在模型开发和部署的整个过程中使用广泛的评估来评估我们的 AI 系统,但我们并不只依赖内部测试。为了识别潜在盲点,我们与多元化的外部合作伙伴合作,包括专业研究实验室、公民社会以及国家 AI 安全与安保研究所(AISI),利用他们的独特专长对我们的模型进行压力测试。
随着 AI 模型能力不断增强,确保模型没有事先见过试题或提示至关重要,因为这可能会使结果产生偏差。政策制定者、研究人员和企业需要相信,AI 基准测试能够准确反映模型的真实能力和安全性;但如果模型能够事先“偷看”评估问题,就可能人为抬高分数并破坏这种信任。
尽管零日志协议和严格的合同保障长期以来一直使外部测试提示保持保密,但引入技术和密码学保障措施标志着安全模型评估向前迈出了重要一步。
双盲评估如何运作
从历史上看,高利害外部评估需要做出取舍。要么评估者交出他们的测试提示(冒着模型提供方事先看到试题的风险),要么模型提供方交出他们的模型权重(冒着知识产权受损的风险)。
双盲评估消除了这种妥协。通过使用 Google Cloud 机密计算产品组合中的 Confidential Space,我们可以通过密码学方式验证外部评估数据和专有模型都对其各自所有者保持私密。评估者无法看到 Gemini 模型权重,Google 也无法看到评估者的测试提示。
一种为模型评估建立信任的新方法
这种密码学证据有助于防止基准污染并保护敏感数据。随着模型能力不断增强,这一点对于高度敏感的评估变得尤为重要,例如用于网络安全或由政府机构开展的评估。双盲评估使独立组织能够在不损害数据主权或安全性的前提下,对先进模型进行严格测试。
我们希望这一试点为模型监督开辟新的前沿,帮助更广泛的行业构建更安全、更可靠且被广泛信任的人工智能系统。如需进一步了解我们的方法与发现,请阅读我们的技术报告。
