Google 论文数学证明:训练数据缺技能时,推理越长错误越爆炸
solyarisoftware · x · 2026-09-06
Google 研究《Understanding the Role of Training Data in Test-Time Scaling》从数学上证明了一个反直觉结论:强迫模型在推理时"想得更久"可能主动损害准确率,引发"灾难性过度思考"。
核心发现:
- 技能覆盖约束:若某项技能在训练数据分布中没有体现,扩大 test-time 计算只会放大噪声,推理链越长错误越爆炸——test-time scaling 只有在模型 underlying 技能已存在时才有效。
- 上下文与算力的权衡:在固定错误率下,扩展测试时推理步数可以大幅缩短训练所需的上下文长度和 in-context 示例数量。
- 特征值难度定律(Eigenvalue Hardness Law):论文给出了任务难度的谱刻画(推文截断处)。
推文还引用了一篇配套的 Test-Time Compute Engineering 长文教程,覆盖动态算力预算、搜索树拓扑、过程奖励验证器等工程化架构设计。
「研究」频道最新
- IndianRailwayBench:用抢印度火车票实测各 LLM 真实能力 — Paimaamu · 2026-09-06
- NEAR AI Lean agent 全解 Putnam Bench,成本仅为次便宜方案的 1/250 — lukaszkaiser · 2026-09-06
- 俄罗斯初创 Mostik 让大模型直连隐藏状态,成本降至 1/20 — 机器之心 · 2026-09-06
- KV缓存原理详解:LLM推理中为何重要且常被误解 — techNmak · 2026-09-06
- AI 用 48 小时写 2 万行 Lean 代码,攻克 98 年未解的数学难题 — 量子位 · 2026-09-06
- 「认知地图作为思维媒介」新文分享 — abenitezburraco · 2026-09-06