# OpenAI 与 PNNL 合作测试用 AI 帮联邦政府写环评报告，每小节能省 1 到 5 小时

> 原标题：Pacific Northwest National Laboratory and OpenAI partner to accelerate federal permitting

- 来源：OpenAI News
- 发布时间：2026-02-26T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/191
- 原文：https://openai.com/index/pacific-northwest-national-laboratory

## 摘要

OpenAI 跟美国能源部旗下的太平洋西北国家实验室（PNNL）合作，找了 19 位专家一起搞了个叫 DraftNEPABench 的测试集，专门看 AI 能不能帮忙起草联邦基建项目的环境评估文件。测试用的是 Codex CLI 这个命令行工具搭配 GPT-5，让模型去读几百页的技术报告、交叉核对资料，再按法规要求写出结构化的分析草稿。在覆盖 18 个...

## 推荐理由

HKR 三项都过了：联邦审批这个场景够意外；有 19 位专家、102 个任务和 1–5 小时的时间节省，信息量不空；争议点在于代理开始碰监管流程，但文章自己划了边界，说这只是起草辅助，不是自动决策。分数没往上拉，因为这只是个限定范围的基准测试，不是已经落地的产品能力。

## 锐评

这条新闻的核心是 OpenAI 和 PNNL 一起做了个叫 DraftNEPABench 的测试集，找了 19 位专家，用 Codex CLI 驱动 GPT-5 去起草联邦基建项目的环境评估文件。测试覆盖了 18 个联邦机构的 102 项任务，模型要读几百页技术报告、交叉核对资料，再按法规写出结构化分析。结果说每个小节能省 1 到 5 小时，整体起草时间大概减少 15%。

这个数字看着不错，但得打个折。首先，测试只衡量了“起草”这个环节，不是完整的环评审批流程。真正的审批涉及多方博弈、现场勘查、公众意见，这些模型都没碰。其次，评分用的是 1-5 分制，3 分算“部分正确”，5 分才“完全正确”，正文没披露平均分到底落在哪，只说“有潜力加速”。另外，19 位专家参与设计基准，但评估是否也由同一批人完成、有没有独立性保障，文章没交代。

还缺什么？一是模型在真实审批场景下的表现，比如面对利益相关方质疑时能不能调整分析；二是错误率数据，环评文件出错可能导致法律风险，光说省时间不够；三是跟现有工具的效率对比，15% 的提升是跟纯人工比还是跟已有模板工具比，没说清楚。
