# 拜耳怎么搭了一套靠谱的多智能体系统，帮科学家翻几十年的安全报告

> 原标题：Building Reliable Agentic AI Systems

- 来源：Hacker News 首页
- 发布时间：2026-06-21T04:28:39.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/39667
- 原文：https://martinfowler.com/articles/reliable-llm-bayer.html

## 摘要

拜耳和 Thoughtworks 一起做了个叫 PRINCE 的平台，核心思路是用多个分工明确的智能体——一个负责搞清楚你到底想问什么，一个负责去资料库里翻报告，一个负责检查翻出来的数据够不够、靠不靠谱，最后一个负责把答案写成合规的草稿——再配上外挂资料库，让科学家能直接用自然语言去查几十年的临床前安全研究数据，甚至生成监管文档的初稿。系统把可靠性押在...

## 推荐理由

我会先打个折：这是篇企业实践分享，不是新品发布，所以分数不会顶满。但它的价值在于把“可靠”两个字拆成了具体架构——拜耳和 Thoughtworks 搞的 PRINCE 平台用四个智能体分工干活，一个负责搞懂你问的到底是什么，一个去资料库里翻几十年的临床前安全数据，一个检查翻出来的东西够不够、靠不靠谱，最后一个把答案写成合规草稿。这套流水线直接对着监管文档生成这个硬骨头，正文给了足够的技术细节，让做企业级智能体的人能抄作业。没给更高分是因为它终究是个案例，不是行业级事件。

## 锐评

拜耳和 Thoughtworks 做的 PRINCE 平台，核心是把查资料这件事拆给了四个智能体：一个先搞清楚你到底想问什么，一个去外挂资料库里翻报告，一个检查翻出来的数据够不够、靠不靠谱，最后一个把答案写成合规的草稿。这个设计的好处是每一步都可追溯，而且关键节点留了人工审核的口子，对制药这种强监管行业很对路。

但文章从头到尾没提准确率、召回率或者处理一个问题的实际延迟。只说“持续用测试集做评估”，没给具体数字。在临床前安全数据这种容错率极低的场景里，没有量化指标就很难判断这套系统到底能不能扛住生产压力。另外，多智能体串联意味着调用链长、出错概率高，运维成本不会低，文章也没展开讲他们怎么处理级联失败。

如果团队本身合规要求高、能接受一定的运维投入，这个架构思路值得参考。但想直接抄作业的人得先想清楚：自己有没有能力补上评估和监控这两块短板。
