# Meta 和 Google 模型的安全护栏几分钟内就被扒掉了

> 原标题：AI guardrails stripped from Meta and Google models in minutes

- 来源：FT · 科技
- 发布时间：2026-05-25T08:31:09.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/27113
- 原文：https://www.ft.com/content/5630ed79-a263-41ed-9a1a-321617ae310e

## 摘要

有软件能让模型回答生物武器和恶意软件的问题，但正文没披露具体是哪些模型、怎么复现、用了什么工具，也没提两家公司有没有应对措施。

## 推荐理由

标题很炸，但正文信息量偏薄。我会先打个折：它只说了有软件能诱导模型输出危险内容，没披露具体是 Meta 和 Google 的哪款模型，也没给复现步骤或缓解方案。这点先别太激动，因为缺了这些技术细节，从业者看完也不知道自己该查什么、怎么防。不过“几分钟拆护栏”这个事实本身，加上涉及两家大厂，已经足够让做安全的人警觉，所以 featured 没问题，只是离必写还差一口气。

## 锐评

这条消息来自 FT 的付费订阅页，我们能看到的只有摘要：有软件能让模型回答生物武器和恶意软件的问题，护栏几分钟内被移除。但正文没披露具体是哪些模型、怎么复现、用了什么工具，也没提两家公司有没有应对措施。

对从业者来说，这种“几分钟绕过”的说法不算新鲜——越狱提示词和微调攻击一直存在，关键在于攻击成本、是否需要模型权重、以及绕过的是 API 层还是本地部署的护栏。这些细节目前全是空白。

在官方公告或技术复现报告出来前，这条只能当标题新闻看。真正值得盯的是：如果攻击不需要模型权重、成本极低，那说明当前对齐技术（RLHF 等）的鲁棒性比想象中差；如果只是某种已知越狱的变体，那新闻价值就大打折扣。还缺攻击面、模型版本和厂商回应，这三块补不上，就没法判断严重程度。
