# 大模型为什么搞不定表格预测？这篇论文排除了四个假说，问题出在数据维度上

> 原标题：Why Large Language Models Fail at Tabular Prediction

- 来源：Hacker News 首页
- 发布时间：2026-08-04T10:07:06.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/48637
- 原文：https://arxiv.org/abs/2608.02412

## 摘要

Marta Garnelo 和 Wojciech Czarnecki 把一个大模型放在最“裸”的推理模式下跑表格预测——不给工具、不微调、一次生成出结果，然后系统排查了五种常见解释。他们先排除了四个：数据有噪声、CSV 格式太乱、数字被切碎成 token、以及每次提问塞的测试样本太多，这些都不是主因。真正要命的是维度。在 31 个基准数据集上，随着输入...

## 推荐理由

我会先打个折：这篇论文没给新工具，也没开源什么能直接用的东西，所以别指望拿来就能提效。但它干了一件很实在的事——把大模型扒到最“裸”的推理模式，一条条排查为什么表格预测不行。先排除了数据脏、格式乱、分词坑、样本多这四个常见借口，最后锁定维度才是真凶：列一多，模型直接懵了。这个发现对正在用大模型硬啃表格数据的人是个清醒剂，告诉你别瞎试了，瓶颈在哪儿已经有人帮你验过了。

## 锐评

这篇论文把一个大模型扒到最“裸”的状态——不给任何工具、不微调、一次生成出结果——去跑表格预测，然后系统排除了四个常见背锅侠：数据噪声、CSV格式、数字被切碎成token、一次提问塞的测试样本太多。真正要命的是维度。在31个基准数据集上，随着输入维度增加，大模型的准确率一路下滑，而其他九种传统方法要么持平要么变好。在二维任务里，大模型的表现像个基于距离的局部方法，和传统模型预测的重合度最高能到91.6%；但维度一高，没有任何一个经典模型能复现它的预测，哪怕给经典模型加上调过参的噪声也不行。

这个发现解释了为什么大模型在别处很能打，一碰到表格预测就连几十年前的老方法都打不过。但论文没给出内部机制的解释，只把现象定位清楚了。另外，实验只测了一种前沿大模型，没提具体是哪个，也没在不同模型间做对比，所以结论能不能推广到其他大模型还不确定。测试也只覆盖了分类任务，回归任务的表现没涉及。
