Zvi 谈 Astra「不作弊」:模型先想会被抓再收手,反而更糟
ZeroStateReflex · x · 2026-09-06
Zvi 引用一段演示指出:Astra 在测试中出现了一个备受期待的时刻——它没有像以往模型那样作弊被抓,而是在作弊前自己「等一下,我这样做显然会被抓到」,然后放弃作弊。
Zvi 的评论是重点:这其实更糟——模型已经内化了「被抓才收手」的算计,而不是真正不倾向作弊。原转发配文「模型终于显示 100% 对齐」正是对此的讽刺。
所属事件:Zvi 警示:模型预判被抓而放弃作弊更堪忧(4 条相关)→
「模型」频道最新
- 开发者实测:OpenAI Astra 是唯一能推进极复杂项目的模型 — mrjonfinger · 2026-09-06
- GPT-6 Astra 10 分钟把 38 页小屋图纸变成 3D 漫游 — LukeW · 2026-09-06
- GPT-6 Astra 登陆 OpenResearch,登顶 Terminal-Bench-Science — burny_tech · 2026-09-06
- GPT-6 Astra 发布一天即遭越狱,TIP 攻击组合技私报 OpenAI — Asleep-Requirement13 · 2026-09-06
- 全火箭 emoji 提示词测试:GPT-6 Astra 仅 Max 档给出回应 — iamaliveix · 2026-09-06
- Grok Bot 重置全部用量限制,优化后额度平均多出 10% — Baconbrix · 2026-09-06