# Forge 给开源小模型加了五层护栏，把智能体任务准确率从 53% 拉到 99%

> 原标题：Show HN: Forge – Guardrails take an 8B model from 53% to 99% on agentic tasks

- 来源：Hacker News 首页
- 发布时间：2026-05-19T12:23:07.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/23790
- 原文：https://github.com/antoinezambelli/forge

## 摘要

Forge 是一个 Python 框架，专门给自部署的大模型做工具调用和多步骤智能体流程。它给 Ministral 8B 这个开源小模型套了五层护栏，在 18 个多步骤智能体场景里把任务成功率从 53% 直接提到 99.3%。作者说这背后有篇被 ACM CAIS ’26 录用的论文撑腰，覆盖了 97 种模型和后端组合，每个场景跑了 50 次。不过正文没...

## 推荐理由

我会先打个折：这是单篇 Show HN 和 GitHub 仓库的展示，还没看到第三方复现或更严苛的对抗测试，所以别直接当生产保证。但它的价值很实在——用 5 层护栏把 Ministral 8B 在代理任务上的表现从不及格拉到接近满分，覆盖了 97 种配置，对想在自己服务器上跑小模型做工具调用的团队来说，省钱的想象空间很大。正文没披露护栏本身会引入多少额外延迟和计算开销，这点先别太激动。

## 锐评

Forge 给 Ministral 8B 这个开源小模型加了五层护栏，专门管工具调用和多步骤流程，在 18 个智能体场景里把成功率从 53% 拉到 99.3%。作者说背后有篇被 ACM CAIS ’26 录用的论文，覆盖了 97 种模型和后端组合，每个场景跑了 50 次，样本量不算小。

但我会先打个折。正文没具体说这 18 个场景是什么，是订机票这种多步骤，还是简单的查天气加发邮件。如果场景偏简单，99.3% 这个数字就没那么惊艳。另外，五层护栏具体怎么设计、每层解决什么问题，正文也没展开，光看 README 很难判断这套方案能不能迁移到其他模型或业务里。

还缺两个关键信息：加了护栏后推理延迟和成本涨了多少，以及有没有在更复杂的真实业务环境里测过。小模型省钱是好事，但如果护栏本身很重，性价比就得重新算。
