Skip to content

捐赠开源对齐工具 Petri

发布日期: 2026-05-07

来源: https://www.anthropic.com/research/donating-open-source-petri


Anthropic 宣布将开源对齐评估工具 Petri 的开发移交给 Meridian Labs。Petri 是一个用于测试大型语言模型对齐行为的开源工具箱,最早在 2025 年 10 月发布。

Petri 是什么

Petri 可以把一系列与对齐相关的场景应用到不同大模型上,用于观察模型在复杂情境下的行为。Anthropic 从 Claude Sonnet 4.5 起就在内部模型评估中使用 Petri。

它的作用不是替代所有安全评估,而是帮助研究者、机构和政府更系统地测试模型在特定风险场景下的表现。

Petri 3.0 的变化

文章提到 Petri 3.0 有几项重要更新:

  • 适应性更强:架构调整后,用户可以更灵活地将 auditor model 和 target model 分离。
  • 更真实:减少模型从测试环境中推断“自己正在被测试”的可能性。
  • 更深入:与 Anthropic 的另一个开源对齐工具 Bloom 集成,可以对特定行为做更深入评估。

为什么要移交给 Meridian Labs

Anthropic 将 Petri 移交给 Meridian Labs,是为了让它成为更中立、更开放的评估基础设施。文章将这一动作与 MCP 的捐赠类比:当某个工具对行业生态有基础设施价值时,把它交给独立组织维护可能更有利于广泛采用。

对 Agent 评估的启示

Petri 的思路对 Agent 产品也有参考价值。Agent 评估不能只看任务完成率,还要看:

  • 是否在边界场景中保持安全;
  • 是否会被诱导绕过规则;
  • 是否能识别测试和真实环境;
  • 是否能在长任务中保持一致行为;
  • 是否能被外部机构复现和审查。

适合阅读的人

  • 做模型安全和对齐评估的人;
  • 设计 Agent eval 的工程师;
  • 关注开源 AI 安全工具的人;
  • 需要向客户解释 AI 评估体系的顾问。
AI 落地咨询
艾维禾砺数字科技

企业 AI 落地全链路服务

Agent 开发工作流搭建Claude Code 集成
微信咨询
d187l8801b6124
访问官网 ivheli.com