研究揭示LLM自我反思效果不佳甚至有害
最新研究对LLM的自我反思机制进行实证测试,选取7种方法在1.5B、3B和7B开源模型上进行数学基准测试,发现自我反思在36次对比中全无胜绩,甚至使模型性能下降10%,并出现“过度思考”现象,即消耗更多token却答错。
2026-08-05 ~ 2026-08-05 · 3 条相关
- 实证打脸自我反思:36次对比全无胜绩,模型自检反降10% — omarsar0 · 2026-08-05
- 7B模型自我反思效果不佳,研究揭示其成本与收益 — srchvrs · 2026-08-05
- 研究揭示 LLM 推理“过度思考”现象:思考越多反而越容易答错 — _jaydeepkarale · 2026-08-05