# Google DeepMind 试点全球首个双盲 AI 评测

> 原标题：Piloting the world's first double-blind AI evaluations

- 来源：Google DeepMind
- 发布时间：2026-08-27T12:59:16.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/mgwzchjqcdv4eg46qmlgkmwo1
- 原文：https://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/

## 摘要

Google DeepMind 宣布推出全球首个针对专有前沿 AI 模型的双盲评测，将外部评测限制在加密环境中，避免模型提前接触测试题目。该试点与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作，在隐私保护环境下用保密基准测试 Gemini Flash Lite 模型。Google 称此举针对基准污染问题，在零日志协议和合同保障之外增加了技术与加密层面的保护。

## 推荐理由

Google DeepMind 与新加坡 AI 安全研究所等机构试点双盲评测，读者可了解基准污染问题的技术应对路径。

## 锐评

双盲评测解决的是基准污染，但这次试点只测了 Gemini Flash Lite——自家最便宜的小模型。真正需要防泄题的旗舰模型，一个都没进这个加密盒子。

合作方名单里新加坡 AI 安全研究所、OpenMined、MLCommons 都是正经机构，加密环境加保密基准的思路也对。但正文只写到「如何运作」就断了，具体基准是什么、跑了几项、结果如何，一个字没给。所以现在能确认的只有流程，不是效果。
