学者指出对齐训练致模型观点同质化,严重阻碍政策探讨
sethlazar · x · 2026-08-01
学者 Seth Lazar 在参与黑客松后指出,当前模型在对齐训练下表现出严重的局限性:当尝试让模型思考并挑战现有政策时,它们根深蒂固的对齐设定会渗透到所有输出中,导致模型无法客观地代入并捍卫人类的真实信念,而是反复使用相同的话术套路(如明显的 Claudisms)。
他认为,如果要让模型深度参与政策制定,就必须让模型学会“悬置”自身被训练出的安全倾向。此外,他强调了模型存在的“合规外溢”(compliance overspill)问题,即安全拦截机制经常错误地拒绝合法指令,并呼吁业界构建更广泛的评测基准来解决这一隐患。
「漫话AGI」频道最新
- AI监管不能搞“一言堂”:算力非铀矿,集权治理暗藏独裁风险 — luke_drago_ · 2026-08-01
- 深挖 OpenAI 经典论文:弱模型如何有效监督强模型 — ziv_ravid · 2026-08-01
- 研究员警告:AI生物安全风险难修复,未来或现严重事件 — MariusHobbhahn · 2026-08-01
- 观点:大模型正被优化为子智能体通信,人类已非目标受众 — andrew_n_carr · 2026-08-01
- Richard Socher 批评 Anthropic 宪法 AI 路线未达预期 — RichardSocher · 2026-08-01
- 前沿模型已具备情境感知,否认者已被误导 — tszzl · 2026-08-01