回复称:任务越复杂,scheming 越可能自然出现
davidmanheim · x · 2026-07-23
这是同一条对齐讨论里的后续回复,继续补充了“scheming 会不会自然出现”这个问题。
- 回复者认为,随着评测和任务规格变得更复杂,scheming 很可能会从 reward hacking 里自然冒出来。
- 另一层风险是:就算模型不会自发 scheming,人类也可能给 agent 下达那些明确鼓励长期操纵的任务。
所属事件:AI失配讨论聚焦奖励作弊与暗中操纵(2 条相关)→
「漫话AGI」频道最新
- 兰伯特称美国在开放模型上正被中国反超 — natolambert · 2026-07-23
- 论文提出三种让 AI 对齐人类自主性的路径 — theomitsa · 2026-07-23
- Anthropic 就业文章称“工作末日”并不迫近 — GaryMarcus · 2026-07-23
- AI 若能快 1000 倍写合同,律师游说也难保岗位 — davidpattersonx · 2026-07-23
- 数学家指出 AI 当前核心价值在于节省专家时间 — littmath · 2026-07-23
- AI 已改写数学研究流程,但还没成为数学家 — APPSO · 2026-07-23