处理表格数据:定制图模型与PFN为何优于LLM

近期多位研究者与从业者围绕“大语言模型(LLM)是否适合处理表格数据”展开讨论,核心结论是:在很多真实场景中,定制图模型或从头训练的 PFNs 比硬套 LLM 效果更好,且当前部分学术审稿意见脱离实际验证能力。

已确认

Gael Varoquaux 确认,PFN 采用原生支持数值输入的架构,无需将数字字符串化,且从头训练;相比之下,像 TabuLa-8B 这类后训练 LLM 方案在处理大表格时表现掉队。Varoquaux 指出,他们尝试了最高 8B 甚至 30B 参数的模型,效果不理想且耗费资源。他强调,表格学习的靠谱评估需要在数百张表上做交叉验证,每张表往往包含数千到几十万行数据,过去评估不足是该方向停滞的重要原因。此外,@yoavgo 和 @roydanroy 在交流中提到,在部分实际业务咨询中,理解领域后发现最合适的方案其实是定制化的图模型(如类似十年前流行的 LDA 变体),而非强行使用 LLM。

尚未确认

关于 NeurIPS 审稿质量的讨论属于研究者主观吐槽与观点碰撞。Gael Varoquaux 等人认为,不少审稿意见看似合理,但在常规研究预算内根本无法用实验去实证证伪。有回复戏谑地建议“按图模型联合分布样本去后训练 LLM”来回应这类审稿意见,这属于社区对学术评审机制的批评与调侃,并非客观事实陈述。

为什么重要

LLM 的能力边界一直是行业关注焦点。此次讨论从技术架构(原生数值 vs 字符串化)和评估方法(跨表交叉验证)层面,具体指出了 LLM 在表格数据任务上的短板,提醒业界在追逐大模型热潮时,不应忽视传统机器学习方法和针对性架构的有效性与经济性。

2026-07-26 ~ 2026-07-27 · 8 条相关

一手来源