Why Large Language Models Fail at Tabular Prediction
Marta Garnelo, Wojciech M. Czarnecki
cs.LG
2026-08-03
前沿大模型做表格分类,五个失败假说只有维度成立:维度过 16 就崩成瞎猜,经典方法纹丝不动,这也是它输给五十年前老办法的原因。
大模型写代码、答问题、起草文档都很能打,唯独在一门最老的机器学习活上反复吃瘪:给一张数值特征的表,让它照着训练行把测试行分类。它输给的是 k 近邻、逻辑回归、决策树这些比 Transformer 早几十年的老办法。反差大到催生了一个新方向:表格基础模型(TabPFN、Nexus、TabICL),它们干脆把「通用大模型做不了表格」当出发点。问题是,这个出发点「通常被断言,没被解释」。这篇要补的就是这个解释:在最干净的推理设置下,到底什么坏了。
作者把模型逼到最纯的形态:一条 prompt 把整张表(训练行加测试行,CSV 格式)塞进去,一次生成出全部预测。没有定制系统提示,没有工具调用,不跑代码,不多轮对话,不微调。这样测的是模型本身的裸能力,主力模型是 claude-opus-4-6,另用 Qwen3-235B-A22B 在二维任务上交叉验证。
然后是五个失败假说,每个配一个受控实验去证伪:
数据集 31 个:11 个真实表(UCI、sklearn,过了一个记忆探测筛子)+ 20 个合成的二维探针。记忆筛子的做法是扣掉某一类的全部行,经典方法按构造只能得 0 分;大模型却把乳腺癌、鸢尾花的原标签几乎原样背了出来(银行票据、葡萄酒也背了大半),说明它在背不在学,这几张表被剔除。对照是 8 个经典基线(1/5/10 近邻、随机森林、逻辑回归、AdaBoost、梯度提升、高斯过程),用多数类作归一化地板,再加一轮 252 个经典模型的扫描,按逐点预测一致性给大模型「画像」。评估走 5 折 × 5 个种子。
前四个假说全被证伪,只剩维度成立:
| 假说 | 受控操纵 | 大模型趋势 | 结论 |
| 可分性 | 类间距逐步拉开 | 斜率 +0.089(逻辑回归 +0.368) | 证伪 |
| CSV 格式 | 目标列混进特征 | r = -0.17,几乎水平 | 证伪 |
| 数字分词 | 保留 1/4/8 位小数 | r = -0.02 | 证伪 |
| 单次预测数 | 全量/半量/四分之一 | 归一化 0.422/0.412/0.407 | 证伪 |
| 维度 | 随机投影到各幂次维度 | 斜率 -0.009/维,r = -0.21 | 成立 |
维度的杀伤很干净:大模型是这九个方法里唯一随维度下降的,斜率 -0.009 每维;到 d ≳ 16,它的归一化分掉到多数类瞎猜以下。其余经典基线全部持平或变好,斜率在 0 到 +0.012 之间。
画像结果分两层。二维下,它像一个基于局部距离的分类器:最接近的是标准化后的 Matérn 高斯过程(长度尺度 1、nu 1.5),网格预测 91.6% 一致;1 近邻 91.0%;前五名全是高斯过程变体。Qwen 上也是距离型方法最接近,结论跨模型成立。高维下画风突变:最像它的经典模型只有 64.8% 一致,前 30 名全挤在 64.0% 至 64.8%。作者又给每个基线加一层随维度变大的噪声再去拟合,平均只把一致性抬高 0.38 个百分点,最多 0.64,拿一个「随维度退化的经典分类器」模拟不出它。
作者还让模型边预测边解释自己用的规则。20 个二维任务里,预测和解释都对上数据的只有 6 个;预测对、解释错的 4 个;两个都不对的 10 个。解释对不上数据的有 14 个,它嘴里说的规则不太能信。
对从业者的直接结论:如果你的表超过大约 15 个数值列,指望靠改 prompt 的格式、精度、批量来救大模型做预测,没戏,这三个方向实验里全被证伪。瓶颈是维度本身,不是提示词手艺。这也解释了表格基础模型为什么必须另起炉灶:TabPFN 这类是专门为表格训练的架构,不是给通用大模型调 prompt。
更关键的是,它把一句模糊的「大模型不行」缩成了一句精确的话:能力随维度溶解,而且没有哪个加了噪声的经典学习器能模仿。这是一个具体的、量化的靶子,留给机制可解释研究去打。
作者自己点了几条。主力实验只压在一个模型上(opus 4.6),Qwen 只验证了二维,他们明说没法保证未来模型一致。整个结论是行为层面的:拿不到权重和激活,匹配的是输入输出,没开盖子看内部电路。数据集也偏玩具:一张 10 万行 × 20 列的表就要约 1600 万输入 token,单次约 80 美元,跑完整评估约 2000 美元;整篇研究光输入 token 就花了约 836 至 941 美元(论文两处口径)。真实生产表动辄百万行,光成本就够把「塞进上下文」这条路否掉,跟准确率无关。
他们也直说没找到内部机制。读完还有一处存疑:二维下 91.6% 的高斯过程一致性、高维下彻底对不上,强烈暗示这是一种扛不住维度灾难的局部距离推理,但论文没证明这个机制。再看「解释对不上数据 14/20」这条,这里的思维链都不要太当真。