研究:大模型进步并非线性,难题提升或源于天花板效应

LChoshen · x · 2026-08-09

研究者指出,当前大语言模型(LLM)的进步不再呈线性,新模型在困难任务上的提升往往超过预期,而简单任务的提升则相对滞后。

这引发了对模型能力发展是否具有普适性的探讨。结合相关论文分析,这种向困难任务倾斜的进步趋势,很大程度上可能是由评测指标的天花板效应造成的,而非模型本身发生了质变。此外,新模型通常搭配更先进的智能体框架运行,这也导致难以界定成绩提升究竟源于模型本身还是外部工具。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →