# ACL 2026 Oral：大模型在短语语义推理上还是“如鲠在喉”

> 原标题：ACL 2026 Oral｜语义推理如鲠在喉：大模型被「短语」难住了

- 来源：机器之心 · 公众号
- 发布时间：2026-06-11T04:30:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/37749
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651038459&idx=3&sn=2fc7962e868aa2d07d46ad1dda53560d

## 摘要

这篇ACL 2026 Oral论文给前沿大模型做了一次短语层面的“体检”，结论有点反直觉：模型能聊但未必真懂。研究把语义理解拆成抽取、分类、释义三步来测，发现没有一个模型能全优。GPT-5在习语分类上能到85.4%，但同一批短语的抽取就掉到78.7%，释义相似度更是只有22.5%。DeepSeek-R1的分类准确率在选项从4个变16个时，直接从81.7...

## 推荐理由

ACL 2026 Oral 论文，用短语层面的三项任务给 GPT-5 和 DeepSeek-R1 做体检，结论反直觉：模型聊天流畅但短语理解拉胯。数字具体，能直接拿来当参考。没给更高分是因为这是单篇学术论文，没有跨源验证，纯基准测试的落地影响有限。

## 锐评

这篇论文把语义理解拆成三步来测：从句子中把短语抽出来、给短语分类、解释短语含义。结果挺打脸——GPT-5 在习语分类上能到 85.4%，但同一批短语的抽取就掉到 78.7%，释义相似度更是只有 22.5%。DeepSeek-R1 的分类准确率在选项从 4 个变 16 个时，直接从 81.7% 跌到 35.4%。这说明模型对短语的理解很脆弱，换个问法就露馅。

更麻烦的是多步串联。上游抽取一出错，下游全跟着歪，GPT-5 端到端的相似度评分直接掉到 17.3%。作者来自北京通用人工智能研究院和北科大，他们自己也说这个静态基准已经跟不上 2026 年 agent 干活的需求了。

正文没披露测试了多少条短语、样本来源是否覆盖多语言。22.5% 的释义相似度具体怎么算的也没展开。如果是真的，说明模型在短语层面基本靠猜，这点先别太激动，等看到完整数据和复现结果再说。
