LLM 文本很强、表格很烂:作者认为是信息供给不足而非数据稀缺
FamiliarSlide7685 · reddit · 2026-09-18
一篇有质量的观察帖:LLM 处理段落文本没问题,但面对一个名为 ref4、存 11 位字符串的列就完全失灵。
核心论点:主流解释是「训练数据中表格少」,作者不同意。文本的语义在 token 里,而表格的列含义分布在列之外——它 join 什么、相邻列是什么、以及当年用这个应用的人记得它在哪个页面。模型不是欠训练,而是欠供给:参数无法恢复输入中从未出现的信息。
未解问题:这是表示问题(喂入 join 图、基数、值分布后足够好的架构能解决),还是有一部分不可约——列的含义只存在于 2021 年离职员工脑子里,多少算力也找不回来?作者倾向后者占一定比例,并自曝利益相关:他们的模型在自由文本字段上表现好、在短编码列上明显更差,且模型变大后差距没有收窄——这是反对他自己乐观的证据。
附带的开放问题:text-to-SQL agent 在 12 张表的 schema 上演示漂亮,到 300 张表就崩,但没人写清断点具体在哪、原因是检索、上下文还是真实 schema 的歧义。
「研究」频道最新
- OnCo 癌症开放知识图谱上线:1.1 万实体串联疗法、试验与瓶颈 — dotey · 2026-09-18
- Tahoe-100M 登上 Cell 特刊,下载量超 60 万次成细胞建模基石 — abeirami · 2026-09-18
- 幽默竞技场:20 款 LLM 讲笑话,Fable 5 以 66.8 分登顶 — Gold-Bat-3225 · 2026-09-18
- 博主实测前沿基准数据,发现Agents' Last Exam CLI子集存在问题 — tokenbender · 2026-09-18
- 「灌水投稿与灌水审稿」:讨论串收尾指向限流与开放评审 — moarbugs · 2026-09-18
- 学术会议弊病之二:周期太长,报告讲出来早已过时 — moarbugs · 2026-09-18