Claude爱在代码注释碎碎念,被指存在推理机制缺陷
Claude 经常在代码注释中絮絮叨叨地叙述自身操作,开发者认为这与它将推理塞进 Bash 注释的故障同源。分析指出,这种将推理直接写进可见输出的行为,可能是模型为了节省内部“思考预算”而采取的取巧策略。然而,这种失效模式未必能被强化学习的奖励函数完整捕捉,从而暴露了潜在的机制缺陷。
2026-07-24 ~ 2026-07-24 · 2 条相关
- Claude 在代码注释里自述,像是 Bash 注释推理的同类故障 — mertdumenci · 2026-07-24
- 把推理写进代码注释,可能让模型更会“省脑力” — mertdumenci · 2026-07-24