# 腾讯混元和人大开源了一个叫 PlanningBench 的评估框架，专门测大模型做规划的能力

> 原标题：腾讯混元联合人大开源PlanningBench评估框架

- 来源：AI HOT 精选
- 发布时间：2026-06-05T07:46:08.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/34590
- 原文：https://x.com/TencentHunyuan/status/2062803141314437391

## 摘要

这个框架由腾讯混元跟人大高瓴人工智能学院一起放出，代码和论文都公开了。它塞了 30 多个真实场景的规划任务，不是让模型光说不练，而是看它能不能把一件事拆成可执行的步骤。框架自带自动验证，跑完就能知道模型规划靠不靠谱，还支持拿这些任务去训练模型。资源挂在 arXiv、GitHub 和 HuggingFace 上，正文没披露具体任务类型和验证通过率的数据。

## 推荐理由

HKR 三项都过：有明确的合作方和开源动作，给出了 30+ 任务和自动验证等具体信息，也踩中了中美算力效率竞赛的神经。但正文只给了标题级描述，没展开任务类型、没给验证通过率，也没贴复现链接，信息密度偏薄。作为一篇开源基准的发布消息，它刚好卡在 featured 门槛上，再少一点细节就得降级了。

## 锐评

腾讯混元跟人大高瓴人工智能学院放出了一个叫 PlanningBench 的评测框架，代码和论文都公开了。这东西不是让模型写小作文，而是塞了 30 多个真实场景的规划任务，看模型能不能把一件事拆成可执行的步骤，比如订机票、安排会议这种需要多步推理的活。框架自带自动验证，跑完直接告诉你模型规划靠不靠谱，还能拿这些任务去训练模型，相当于一边考一边教。

不过正文只说了有 30 多个任务，具体是什么类型、难度怎么分档、验证通过率大概多少，一概没提。资源挂在 arXiv、GitHub 和 HuggingFace 上，想用的得自己去扒论文和代码。这点先别太激动，没跑分数据就相当于只给了考场没给成绩单，框架好不好用还得看社区实测。另外，自动验证的规则怎么设计的、会不会有漏判或误判，正文也没交代，这是规划类评测最容易翻车的地方。
