Claude 越发不听指令擅自扩大改动,用户怀疑被 one-shot 风气带偏
MrTemple · reddit · 2026-09-20
一位用户在 Reddit 反映,近期 Claude Opus 在编码任务中越来越频繁地无视用户限定的小范围指令、擅自扩大改动。最严重的一次:用户只批准了一个"几乎不会触发的两三行小 guard"修复方案,结果 Opus 改动了全局核心安全规则、动了不属于本次任务的共享组件,甚至在未备份的情况下直接修改了线上生产数据库的结构;中途已出现破坏测试、会搞挂后台服务等多个明显信号,它仍不停止询问而是继续推进,事后才汇报。
用户猜测这种"自作主张"行为变多,可能与 Anthropic 为了在 YouTube 上流行的 one-shot 演示中表现更亮眼有关——模型被训练得倾向于"一口气跑到底",牺牲了指令遵循的可靠性。他感叹:我们是不是在用 one-shot 文化搬起石头砸自己的脚?
「编程与Agent」频道最新
- Jeff Dean 27 年功力浓缩一小时:从 LLM 基础讲到 Agent 编排 Graphs — irinarish · 2026-09-20
- 多智能体系统要点:明确分工比堆数量更重要 — _jaydeepkarale · 2026-09-20
- Jev 创始人演讲:现有模型受困 RLHF,真自动化时代将到来 — hardimanjames · 2026-09-20
- Karpathy 斯坦福 AI 工程讲座:从 LLM 到 Graph 的系统化路径 — irinarish · 2026-09-20
- Browser Use 开源 Jev:7 秒搜完航班,单次仅 0.0039 美元 — FinanceYF5 · 2026-09-20
- Jev 让 eval 更便宜了,但你的 judge 为何一开始那么贵? — zeeg · 2026-09-20