# Anthropic 发布 AI 智能体零信任安全框架

> 原标题：AI智能体的零信任安全框架

- 来源：AI HOT 精选
- 发布时间：2026-05-27T18:06:27.746Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/28771
- 原文：https://claude.com/blog/zero-trust-for-ai-agents

## 摘要

Anthropic 发了篇博客，讲企业里用自主 AI 智能体（能自己调用工具、读写记忆的模型）该怎么搞安全。核心判断是：前沿模型把漏洞利用的时间从几个月压到了几小时，老一套安全流程跟不上。文章给了一套三层零信任架构，把智能体拆成身份层、工具层和记忆层分别做权限最小化，还列了八个阶段的落地步骤。威胁模型里重点提了提示注入、工具投毒和记忆投毒这三种攻击方式...

## 推荐理由

Anthropic 这份零信任框架把攻击速度的变化说得很直白——前沿模型能把漏洞利用周期从几个月压到几小时，这个数字本身就是最好的警示。三层架构和八阶段流程让方案有了骨架，提示注入这些威胁也点得实在。我会先打个折：正文没披露具体验证数据或落地案例，目前更像一套设计原则而非实测报告。但安全、智能体、权限这几个话题叠加，对正在推 agent 上线的团队来说，参考价值不低。

## 锐评

这篇博客最值得看的是威胁模型里的时间压缩判断：以前攻击者从发现漏洞到利用可能要几个月，现在前沿模型几小时就能搞定。这个数字说明，如果你让一个能自己调用工具、读写记忆的模型进业务流程干活，传统的定期审计和事后补丁基本等于裸奔。

Anthropic 给的方案是把智能体拆成三层——身份层管谁能用、工具层管能碰什么系统、记忆层管能记住什么——每层都做权限最小化。这跟传统零信任的思路一致，但落地到 AI 智能体上多了几个坑：提示注入（有人往输入里塞恶意指令）、工具投毒（篡改模型调用的 API 返回结果）、记忆投毒（污染模型的长期记忆让它以后做错事）。博客列了八个阶段的落地步骤，从盘点资产到持续监控都有，算是给安全团队一个现成的 checklist。

不过得打个折。这是 Anthropic 的官方博客，不是独立安全评估，没有第三方验证，也没有披露这套框架在他们自己产品里的实际部署效果和事故数据。另外，正文没提这套架构的性能开销——每层都做鉴权和隔离，延迟会增加多少、成本会涨多少，这些关键数字都缺。企业真要落地，得自己先在小范围跑一遍看看账划不划算。
