7B模型自我反思效果不佳,研究揭示其成本与收益

srchvrs · x · 2026-08-05

一项新研究测试了自我反思循环是否值得。实验设置:七种方法,使用1.5B、3B和7B的开源模型,在两个数学基准上各150个问题。每个生成的token都被计数,包括用于批评、反思、辩论和检查的token。每种方法与在自身测量成本下的重复采样进行比较,按问题配对,并带有bootstrap置信区间。初步结果显示,小型模型(如7B)的自我反思效果不佳,这可能是因为它们缺乏前沿模型的能力。

所属事件:研究揭示LLM自我反思效果不佳甚至有害(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →