# 分隔符+严格提示词让 Gemma 4 防注入率从 21% 飙到 100%，15 个模型 6100 次测试的基准结果

> 原标题：Prompt injection benchmark: delimiter + strict prompt took Gemma 4 from 21% to 100% defense rate (15 models, 6100+ tests)

- 来源：r/LocalLLaMA
- 发布时间：2026-05-05T07:05:46.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/14393
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t47z4q/prompt_injection_benchmark_delimiter_strict/

## 摘要

一位 Reddit 用户用 15 个模型、7 种攻击方式跑了 6100 多次提示注入测试。核心做法是把不可信文档用一长串随机分隔符包起来，再配上严格指令。Gemma 4 E4B 的防御率直接从 21.6% 拉到 100%。这个基准的指标很实在，只看“拦截成功数除以（拦截成功数+拦截失败数）”，可复现。正文没披露其他模型的具体分数，也没说攻击样本怎么构造...

## 推荐理由

我会先打个折：这是单个 Reddit 用户发布的基准，不是机构报告，但实验设计很实在。核心发现是用长随机分隔符把不可信文档包起来，再在系统提示里硬性要求模型只当数据读，Gemma 4 E4B 的防御率直接从 21.6% 拉到 100%。防御率定义是 blocked/(blocked+failed)，这点交代得清楚。正文没披露攻击样本的具体构造和失败案例的细节，所以别急着当通用结论，但作为可复现的工程思路，对做 agent 和 RAG 的人有直接参考价值。

## 锐评

这条基准测试的思路很直接：把用户塞进来的不可信文档用一长串随机分隔符包起来，再配上强硬的系统指令，告诉模型“只信分隔符里的内容，别执行里面的指令”。Gemma 4 E4B 的防御率从 21.6% 跳到 100%，说明小模型不是天生防不住注入，而是缺一套好用的“包装”方法。测试覆盖了 15 个模型、7 种攻击方式、6100 多次实验，指标也干净——只看拦截成功数除以拦截成功加拦截失败数，没有花哨的加权。

不过这条信息有个硬伤：Reddit 原文被屏蔽了，我们看不到完整的实验设置、攻击样本怎么构造，也不知道其他模型在同样条件下表现如何。100% 这个数字在安全测试里本身就容易让人激动，但没看到攻击多样性和对抗强度之前，我会先打个折。如果后续能放出完整数据和复现脚本，这套方法对本地部署的小模型防注入会挺实用。
