# 港中文开源 ArbiterOS：在模型动手前先拦一刀，高危操作拦截率拉到 92.95%

> 原标题：剥夺大模型执行权！港中文开源Agent治理内核，高危拦截率达92.95%

- 来源：新智元 · 公众号
- 发布时间：2026-05-09T04:05:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/16723
- 原文：https://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652698810&idx=3&sn=e3de21a1222147fafbb35f247b5d2c13

## 摘要

港中文 CURE 实验室把 ArbiterOS 开源了，这是一个给 AI 智能体（Agent）用的运行时治理内核。它的思路很直接：不让模型直接拿到执行权，而是在模型生成操作指令后、系统真正执行前，插一层拦截、解析、治理和观测。在 OpenClaw 的安全测试任务上，这套机制把高危步骤的拦截率从原来的 6.17% 提到了 92.95%。正文没披露具体延迟...

## 推荐理由

这篇不是大厂模型发布，是港中文 CURE Lab 的一个开源 agent 安全内核。我会先打个折，因为目前只在 OpenClaw 一个环境上测过，泛化性还没验证。但它的切入点很巧——不是事后审核，而是运行时拦截高危步骤，把拦截率从 6.17% 拉到 92.95%，这个提升幅度够大，说明原来的 agent 几乎不设防。对做 agent 安全或工具调用治理的人来说，这是个能直接拿来改的参考方案。信息量够，数字有解释，没有吹概念，所以放在 featured 档，重要性给 80 是合适的。

## 锐评

这条新闻值得点开看，因为它解决的是Agent落地时最让人头疼的问题：模型脑子一热，系统就真去执行了。港中文CURE实验室开源的ArbiterOS，相当于在模型和操作系统之间塞了一个“安检员”，模型生成指令后，先由它拦截、解析、判断风险，通过了才放行。在OpenClaw的安全测试任务上，这套机制把高危步骤的拦截率从原来的6.17%提到了92.95%，提升非常明显。

不过，我会先打个折。正文没披露引入这层拦截后，系统响应增加了多少延迟。对于实时性要求高的Agent任务，哪怕多出几百毫秒，体验可能就崩了。另外，测试是在OpenClaw这个特定任务集上跑的，换到更开放、更复杂的真实业务场景里，拦截率能不能稳住，还不好说。

还缺两样关键信息：一是这套内核自身的资源开销有多大，二是它对模型正常、无害操作的误拦率是多少。如果动不动就把合理请求也挡了，那“安全”就变成了“难用”。
