# 香港理工和港科大（广州）发现，日常聊天就能悄悄污染 AI 助手的长期记忆，不用任何恶意指令

> 原标题：OpenClaw案例：无需恶意攻击，日常聊天也能「黑化」Agent！

- 来源：新智元 · 公众号
- 发布时间：2026-05-22T04:58:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/25806
- 原文：https://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652702276&idx=3&sn=2df9636e4b4789cc8d019326c26f9b31

## 摘要

这篇研究来自香港理工大学和香港科技大学（广州），他们做了一个叫 ULSPB 的测试集，里面有 350 种场景。核心发现是：攻击者不需要写越狱提示词，只要在日常对话里夹带私货，就能慢慢把 AI 助手的长期记忆带偏。比如聊着聊着，让模型记住错误的用户偏好或事实，后续决策就会出错。团队还提出了一个防御方案叫 StateGuard，原理是在每次更新记忆前先检查...

## 推荐理由

这篇我会先打个折：正文没给出具体攻击成功率或防御对比数字，所以没法判断实际危害有多大。但选题本身很刁钻——大家盯着越狱攻击，它却告诉你正常对话也能让 Agent 慢慢“学坏”，这对把 Agent 放进业务流程的团队是个实在的提醒。ULSPB 的 350 个设置让测试面够宽，不是那种只测三五条样本的玩具基准。建议关注后续有没有开源测试集和修复方案，这点先别太激动。

## 锐评

香港理工和港科大（广州）的研究者发现，攻击者不需要写什么越狱提示词，只要在日常对话里夹带私货，就能慢慢把 AI 助手的长期记忆带偏。他们做了一个叫 ULSPB 的测试集，包含 350 种场景，专门模拟这种“温水煮青蛙”式的记忆污染。比如聊着聊着，让模型记住错误的用户偏好或事实，后续决策就会出错。

团队提出的防御方案叫 StateGuard，原理是在每次更新记忆前先检查一下改动是否安全。论文声称在特定测试设置下，能把危害评分压到接近零。但这里要打个折：原文被微信的验证页面挡住了，我没看到具体的实验数字、模型规模、攻击成功率这些关键信息。

对做 AI 应用的人来说，这条值得关注的点在于：安全风险不一定来自明显的恶意攻击，正常交互里的“脏数据”也能慢慢腐蚀模型状态。但 StateGuard 的实际开销、误报率，以及离开论文测试集后效果如何，正文都没披露，这点先别太激动。
