Google 论文数学证明:训练数据缺技能时,推理越长错误越爆炸

solyarisoftware · x · 2026-09-06

Google 研究《Understanding the Role of Training Data in Test-Time Scaling》从数学上证明了一个反直觉结论:强迫模型在推理时"想得更久"可能主动损害准确率,引发"灾难性过度思考"。

核心发现:

推文还引用了一篇配套的 Test-Time Compute Engineering 长文教程,覆盖动态算力预算、搜索树拓扑、过程奖励验证器等工程化架构设计。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →