# Databricks 把 GPT-5.5 接进企业智能体工作流，在 OfficeQA Pro 上首次突破 50% 准确率

> 原标题：Databricks将GPT-5.5引入企业智能体工作流

- 来源：AI HOT 精选
- 发布时间：2026-05-15T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/21515
- 原文：https://openai.com/index/databricks

## 摘要

Databricks 通过自家的 AI Unity Gateway，把 GPT-5.5 用在了 AgentBricks 和 Agent Supervisor API 搭建的智能体工作流里。在专门考验模型处理扫描件、老旧文件和长文档能力的 OfficeQA Pro 基准上，GPT-5.5 比上一代 GPT-5.4 的错误率降低了 46%，成了第一个准确率...

## 推荐理由

GPT-5.5 被 Databricks 接进企业智能体工作流，在 OfficeQA Pro 上准确率首次过半，错误比 GPT-5.4 少了 46%。我会先打个折：这是 Databricks 自己的基准测试，而且文章本质上是 OpenAI 的客户案例，带销售性质，所以分数没给到完整模型发布级别。但对企业 AI 团队来说，这条信息在选型和落地判断上确实有参考价值。

## 锐评

这条消息来自 OpenAI 官网，本质是一篇客户证言，不是第三方评测。Databricks 把 GPT-5.5 接进了自己的智能体工作流，用 AI Unity Gateway 做中转，让模型在 AgentBricks 里调度解析、检索和执行。他们自己搞的 OfficeQA Pro 基准专门测扫描件、老旧文件和长文档，之前很多生产系统都栽在这类任务上。GPT-5.5 在这个测试上错误率比 5.4 降了 46%，准确率首次超过 50%，Databricks 的研究工程师说 5.5 在解析老文档和扫描 PDF 时有“台阶式提升”，而且不会像 5.4 那样跑偏去做无效搜索。

但要注意，正文没披露测试样本量、任务难度分布，也没说对比的其他模型是谁、有没有做过公平调参。50% 的准确率虽然被标成“业界第一”，放在实际业务里还是有一半会出错，别被百分比迷惑。另外，文章只提了 Databricks 自己的网关和工作流框架，没讲这套方案在别的平台能不能复现，也没给延迟和成本数据。对想跟进的团队来说，现在还缺独立复现和更多场景下的对照结果。
