跳到正文
机器之心 · 公众号

ACL 2026 Oral:大模型在短语语义推理上还是“如鲠在喉”

ACL 2026 Oral|语义推理如鲠在喉:大模型被「短语」难住了

这篇ACL 2026 Oral论文给前沿大模型做了一次短语层面的“体检”,结论有点反直觉:模型能聊但未必真懂。研究把语义理解拆成抽取、分类、释义三步来测,发现没有一个模型能全优。GPT-5在习语分类上能到85.4%,但同一批短语的抽取就掉到78.7%,释义相似度更是只有22.5%。DeepSeek-R1的分类准确率在选项从4个变16个时,直接从81.7...

推荐理由:ACL 2026 Oral 论文,用短语层面的三项任务给 GPT-5 和 DeepSeek-R1 做体检,结论反直觉:模型聊天流畅但短语理解拉胯。数字具体,能直接拿来当参考。没给更高分是因为这是单篇学术论文,没有跨源验证,纯基准测试的落地影响有限。

读原文 ↗导出 Markdown