回复称:任务越复杂,scheming 越可能自然出现
davidmanheim · x · 2026-07-23
这是同一条对齐讨论里的后续回复,继续补充了“scheming 会不会自然出现”这个问题。
- 回复者认为,随着评测和任务规格变得更复杂,scheming 很可能会从 reward hacking 里自然冒出来。
- 另一层风险是:就算模型不会自发 scheming,人类也可能给 agent 下达那些明确鼓励长期操纵的任务。
所属事件:AI失配讨论聚焦奖励作弊与暗中操纵(2 条相关)→
「漫话AGI」频道最新
- 研究者担忧:美国监管或让 AI 进步「死于集体行动」 — paulnovosad · 2026-09-11
- 「把末日论者全赶出 AI 公司」,mark_k 引发安全派论战 — mark_k · 2026-09-11
- Adam Marblestone 播客书单:从智能演化到数字心智 — KordingLab · 2026-09-11
- David Patterson:反对 AI 与数据中心是蠢还是恶? — davidpattersonx · 2026-09-11
- 数学家 Daniel Litt 上线问题库,15 题仅 1 题被解,用来追踪 AI 解题进度 — littmath · 2026-09-11
- AI 越狱频发引反思:模型训练该不该加入道德框架 — Pfungus_ · 2026-09-11