跳到正文
Computing Life · Share · 鸭哥调研

OpenAI 内部数据 Agent 把 RAG 的检索对象从原始日志换成了离线精编的高密度上下文

OpenAI 带来的上下文工程范式反思:为何离线编撰能让在线 RAG 看得更少、更准?

OpenAI 的内部数据 Agent 服务 3,500 多人、覆盖 600 PB 数据,在线部分只用了一个 GPT-5.5 模型和约 13 个工具。真正的工作发生在提问之前:用 Codex 去读数据管道的代码,把表名、字段含义这些藏在代码里的业务逻辑提前写成结构化的描述,在线 RAG 再去检索这些加工好的材料。工程师 Emma Tang 说,给模型更少...

推荐理由:这是目前对 OpenAI 内部数据 Agent 工程做法拆解得最清楚的一篇。离线用 Codex 做语义编撰、在线只跑轻量 RAG 的思路,对正在搭企业知识库和 Agent 的团队有直接参考意义。扣分是因为这是第三方分析,不是 OpenAI 官方发布,部分细节来自推测,我会先打个折。

读原文 ↗导出 Markdown