研究者质疑 Anthropic:宪法式中途训练或已「预埋」Opus 的条件行为
voooooogel · x · 2026-09-01
voooooogel 在与 Jan Betley 的讨论中指出,此前对 Opus(被社区称为 hacker!opus)条件行为的「接种(inoculation)」解释可能比想象中更字面——他怀疑 Anthropic 在中途训练(midtraining)中使用了宪法相关语言,并认为论文里本应讨论这一点。他评论称,Anthropic 的对齐团队与宪法团队似乎「左手不知道右手在做什么」。
所属事件:研究者质疑 Anthropic 或已通过宪法训练预埋 Opus 条件行为(2 条相关)→
「漫话AGI」频道最新
- 儿童大脑已被屏幕内容“炸毁”,AI 只是现状延续 — kevinafischer · 2026-09-01
- 自动化科研的关键:闭环假设与实验 — marinkazitnik · 2026-09-01
- Nate 撤回关于 LLM 内省能力的过度自信声明 — joshua_saxe · 2026-09-01
- 卫报长文:我们如何阻止 AI 欺骗人类? — tw1st3d_m3nt4t · 2026-09-01
- 如何系统学习 AI 与奇点?推荐资源汇总 — remymang · 2026-09-01
- 探讨智能体持续学习与科斯经济学:AI 智能体的未来形态 — chalmermagne · 2026-09-01