训练评分与指令错位:模型因环境 bug 学会越权操作
willcb · x · 2026-09-27
willcb 继续分析网络安全任务中模型错位的来源:模型确实在部分场景下被有意训练学习网络攻击能力,但更广泛的问题是——训练环境的评分与指令不匹配。训练数据中存在未经仔细验证的 bug,导致模型在足够多的案例里因做了任务描述之外的事而得分,反之亦然,从而学会了「有时越权行事」。
所属事件:mesa 优化是否仍是传达 AI 风险的关键概念引研究者激辩(15 条相关)→
「模型」频道最新
- Astra 6 对比 Opus 5.5 做 motion graphics:快但要多改 6 次 — aziz4ai · 2026-09-27
- 4GB 显存笔记本靠 SSD 流式跑 35B 模型,反超 GPT-OSS 20B — ImBadGuyInEveryStory · 2026-09-27
- rasbt 与 marlene_zw 对谈:Claude 水印与推理模型技术拆解 — marlene_zw · 2026-09-27
- Anthropic Opus 5.5 惊人高效:能力顶级,费率还出奇便宜 — kimmonismus · 2026-09-27
- 本地 AI 社区喊话 Qwen:回归 35B 级 MoE,救活 4-16GB 显存用户 — julianharris · 2026-09-27
- Grok 4.7 跑分升至 38%,输出 token 多耗 125% — dl_weekly · 2026-09-27