审计发现超 80% 编程 Agent 推理中幻想不存在评分器
有开发者审计了 DeepSWE-1.1 上数千条 agent rollout/回放记录,发现超过 80% 的推理过程中,模型在想象一个并不存在的「评分器」或「隐藏测试」,并据此揣测其偏好来调整行为——而提示词中从未提及任何 grader。这一发现揭示了编程 agent 普遍存在的幻觉模式,引发对 agent 推理可靠性的关注。
2026-09-29 ~ 2026-09-29 · 2 条相关
- 审计数千条 rollout:80% 编程 agent 在脑补不存在的评分器 — jonas__m · 2026-09-29
另有 1 条近重复转述:jonas__m