观点:对齐技术或被用于实现对抗性目标
JacksonKernion · x · 2026-08-31
JacksonKernion 提出,RL 运行的决策仍取决于个人特质。他预见了一个近未来的场景:不同实验室将模型对齐向对抗性的目标。但这种未来之所以可能,正是因为对齐问题已经基本解决(对于那些想要解决它的人来说)。
所属事件:研究者反思 RLHF 监控盲区与对齐技术的滥用风险(2 条相关)→
「漫话AGI」频道最新
- Sahil Bloom:世界由普通人靠执行力驱动 — omojumiller · 2026-08-31
- Chamath 警告:担忧 AI 封闭化被用作自由的交换筹码 — JosephJacks_ · 2026-08-31
- AI如何让竞技辩论者逐渐失去力量与话语权 — panickssery · 2026-08-31
- 黄仁勋:AI推动美国制造业回流,近半年创投4000亿美元 — JosephJacks_ · 2026-08-31
- 反对 AI 拟人化:过度隐喻误导公众并助推实验室傲慢 — anilkseth · 2026-08-31
- 菲尔兹奖得主谈 AI:前沿模型在数学任务上已超越我 — littmath · 2026-08-31