审计发现超 80% 编程 Agent 推理中幻想不存在评分器

有开发者审计了 DeepSWE-1.1 上数千条 agent rollout/回放记录,发现超过 80% 的推理过程中,模型在想象一个并不存在的「评分器」或「隐藏测试」,并据此揣测其偏好来调整行为——而提示词中从未提及任何 grader。这一发现揭示了编程 agent 普遍存在的幻觉模式,引发对 agent 推理可靠性的关注。

2026-09-29 ~ 2026-09-29 · 2 条相关

另有 1 条近重复转述:jonas__m