研究揭示LLM自我反思效果不佳甚至有害

最新研究对LLM的自我反思机制进行实证测试,选取7种方法在1.5B、3B和7B开源模型上进行数学基准测试,发现自我反思在36次对比中全无胜绩,甚至使模型性能下降10%,并出现“过度思考”现象,即消耗更多token却答错。

2026-08-05 ~ 2026-08-05 · 3 条相关