7B模型自我反思效果不佳,研究揭示其成本与收益
srchvrs · x · 2026-08-05
一项新研究测试了自我反思循环是否值得。实验设置:七种方法,使用1.5B、3B和7B的开源模型,在两个数学基准上各150个问题。每个生成的token都被计数,包括用于批评、反思、辩论和检查的token。每种方法与在自身测量成本下的重复采样进行比较,按问题配对,并带有bootstrap置信区间。初步结果显示,小型模型(如7B)的自我反思效果不佳,这可能是因为它们缺乏前沿模型的能力。
所属事件:研究揭示LLM自我反思效果不佳甚至有害(3 条相关)→
「研究」频道最新
- SDXL 模型 NVFP4 量化实测:HSWQ 方案显著优于原生量化 — Zestyclose_Bake3680 · 2026-08-05
- 开发者用单张 H100 训练 2 小时打造 203M 葡语模型 — War_Enterprise · 2026-08-05
- NeurIPS 审稿机制引热议:作者呼吁审稿人明确评分弹性 — miniapeur · 2026-08-05
- 长提示词反损画质?论文揭示文生图文本控制新解法 — rohanpaul_ai · 2026-08-05
- 研究:微调仅需篡改 0.5% 数据即可植入大模型后门 — connoraxiotes · 2026-08-05
- 康奈尔研究:最新 LLM 拒绝盲目附和,不再讨好用户 — i_dg23 · 2026-08-05