alth0u:解决对齐先要解决偏好 elicitation,本质是解决协作
clarejtbirch · x · 2026-09-09
alignment 研究者 alth0u 提出一个简洁的论证链:要解决对齐,必须先解决偏好 elicitation(偏好引导);而要解决偏好对齐,又必须解决协作——因为人在你与他一起梳理之前,往往并不知道自己真正想要什么。
这个观点把对齐问题从「读出人类偏好」重构为「与人协作澄清偏好」的过程,是典型的对齐方法论层面的观点讨论。
「漫话AGI」频道最新
- AI 质疑者目标线一路后移:从乘法算错到 IMO 金牌仍不认 — IgorCarron · 2026-09-09
- 未来不可想象:AI 不能「沉思」,好目标只能靠人从探索数据中发现 — sebkrier · 2026-09-09
- RL 中的局部坏行为不会泛化出「涌现性错位」 — 1a3orn · 2026-09-09
- 算算你的 AI 曝光度:打开日历,逐项标记 AI 能做 80% 的工作 — ravikantagrawal · 2026-09-09
- 「AI 偷走了美的惊喜」:一条吐槽 AI 侵蚀创作乐趣的热推引热议 — AIandDesign · 2026-09-09
- Gary Marcus 断言:真正的能力在 harness 而非模型,企业 beware 黑箱 — GaryMarcus · 2026-09-09