资讯

谷歌推出全球首个双盲 AI 评估技术,基于加密环境保障基准测试公正性

IT之家·2026/8/27 13:01:39🔗 原文

📌 概要

<p>IT之家 8 月 27 日消息,谷歌宣布推出<strong>全球首个针对前沿专有 AI 模型的双盲评估</strong>,将外部评估限制在加密“黑箱”环境中,避免模型提前获取测试信息来优化性能。</p><p>就像学生考前不能提前看到试题才能真实反映水平一样,当前 AI 模型评估也面临同样问题:如果模型提前接触测试题目(IT之家注:也就是所谓的“基准污染”),评估结果的可信度就会大打折扣。</

<p>IT之家 8 月 27 日消息,谷歌宣布推出<strong>全球首个针对前沿专有 AI 模型的双盲评估</strong>,将外部评估限制在加密“黑箱”环境中,避免模型提前获取测试信息来优化性能。</p><p>就像学生考前不能提前看到试题才能真实反映水平一样,当前 AI 模型评估也面临同样问题:如果模型提前接触测试题目(IT之家注:也就是所谓的“基准污染”),评估结果的可信度就会大打折扣。</p><p style="text-align: center;"><img class="no-alt-img" id="1787835826261_2" src="https://img.ithome.com/newsuploadfiles/2026/8/a4b41fd6-ae4f-49ee-a8b6-1c20b51c18ef.png" /></p><p>谷歌联合新加坡人工智能安全研究所、OpenMined、AVERI 以及 MLCommons,在隐私保护环境中对 Gemini Flash Lite 模型进行机密基准测试,提升评估结果的完整性。</p><p>传统高风险外部评估一直存在两难困境:要么<strong>评估方交出测试提示词</strong>,存在模型方提前看到题目的风险;要么<strong>模型方交出模型权重</strong>,面临知识产权泄露风险。</p><p>双盲评估则解决了这一矛盾,通过谷歌云保密计算产品组合中的 Confidential Space,能够通过加密验证,保证外部评估数据和专有模型分别对各自所有者保持隐私:评估方无法看到 Gemini 模型权重,谷歌也无法看到评估方的测试提示词。</p><p style="text-align: center;"><img class="no-alt-img" id="1787835818810_1" src="https://img.ithome.com/newsuploadfiles/2026/8/274e8e4b-b05a-4d10-9f48-4dae2e1b5b55.png" /></p><p>这种加密手段可以有效防止基准污染,同时保护敏感数据,对于网络安全或政府机构开展的高敏感度评估尤其重要。双盲评估让独立机构能够在不损害数据主权和安全的前提下,对先进 AI 模型进行严格测试。</p><p>谷歌表示,希望这一试点能够为模型监督开辟新方向,帮助整个行业构建<strong>更安全、更可靠、更受公众信任的 AI 系统</strong>。</p>