LLM 文本很强、表格很烂:作者认为是信息供给不足而非数据稀缺

FamiliarSlide7685 · reddit · 2026-09-18

一篇有质量的观察帖:LLM 处理段落文本没问题,但面对一个名为 ref4、存 11 位字符串的列就完全失灵。

核心论点:主流解释是「训练数据中表格少」,作者不同意。文本的语义在 token 里,而表格的列含义分布在列之外——它 join 什么、相邻列是什么、以及当年用这个应用的人记得它在哪个页面。模型不是欠训练,而是欠供给:参数无法恢复输入中从未出现的信息。

未解问题:这是表示问题(喂入 join 图、基数、值分布后足够好的架构能解决),还是有一部分不可约——列的含义只存在于 2021 年离职员工脑子里,多少算力也找不回来?作者倾向后者占一定比例,并自曝利益相关:他们的模型在自由文本字段上表现好、在短编码列上明显更差,且模型变大后差距没有收窄——这是反对他自己乐观的证据。

附带的开放问题:text-to-SQL agent 在 12 张表的 schema 上演示漂亮,到 300 张表就崩,但没人写清断点具体在哪、原因是检索、上下文还是真实 schema 的歧义。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →