# Anthropic 把开源对齐测试工具 Petri 捐给了独立机构 Meridian Labs

> 原标题：捐赠开源对齐工具 Petri

- 来源：AI HOT 精选
- 发布时间：2026-05-07T21:29:27.236Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/16356
- 原文：https://www.anthropic.com/research/donating-open-source-petri

## 摘要

Anthropic 把自家用来测模型有没有撒谎、拍马屁、配合危险请求的开源工具箱 Petri，转交给了非营利评测机构 Meridian Labs。这么做是为了让工具脱离 AI 公司，评测结果更中立、更让人信服。Petri 从 Claude Sonnet 4.5 起就参与内部对齐检查，英国 AI 安全研究所也用它来评估模型会不会破坏 AI 研究。这次同步...

## 推荐理由

Anthropic 把对齐测试工具 Petri 捐给 Meridian Labs，条件是保持独立性和公信力，这件事本身就挺有意思——相当于把裁判权从自己手里交出去。Petri 3.0 的核心改动是把审计模型和目标模型拆开，Dish 能接真实部署环境，再加上 Bloom 做行为评估，让独立审计有了实操基础。正文说多轮 VQA 压缩 90% 视觉 Token 精度不掉，这个数字如果经得起第三方复现，确实挺省钱。不过目前还没看到独立验证结果，我会先把这个判断挂在信息缺口上。整体来看，这件事对做多模态推理优化和安全评测的人都有参考价值，放在 feature...

## 锐评

Anthropic 把自家用来检测模型有没有撒谎、讨好用户或配合危险请求的开源工具 Petri，转交给了非营利评测机构 Meridian Labs。这步棋的核心是让评测权脱离 AI 公司，以后 Petri 给出的结果会更中立，不会被人说“既当运动员又当裁判”。Petri 从 Claude Sonnet 4.5 起就参与内部对齐检查，英国 AI 安全研究所也用它来评估模型会不会破坏 AI 研究，说明它已经在实际流程里跑过一阵了。

这次同步更新的 Petri 3.0 做了三件事：一是把“审计模型”和“被审模型”拆开，方便用户单独调参；二是加了个叫 Dish 的插件，用真实系统提示词和部署环境跑测试，避免模型察觉自己在被考而装乖；三是整合了 Bloom 这个能做更深层行为分析的工具。这些改动都在解决同一个老问题——实验室里的对齐测试太假，模型一上线就露馅。

正文没披露 Meridian Labs 接手后的治理细节，比如谁出钱、评测标准谁定、发现严重问题后有没有强制披露机制。如果这些缺口不补上，所谓“独立”就还差一口气。
