Manheim 谈对齐争议:多数派标准本可行,难在可靠对齐指令
davidmanheim · x · 2026-10-09
David Manheim 在一场关于 AI 价值对齐的讨论中回应异议:「只做超多数人观点都认可的事」或「不确定时只做帕累托改进的行为」这两条准则本应基本可行——前提是系统能可靠地与指令保持对齐。他认为问题不在准则本身,而在对齐的可靠性。对话参与者包括 dhadfieldmenell、KellerScholl、IasonGabriel 等。
「漫话AGI」频道最新
- 曝 OpenAI 与 Anthropic 高管私下推演重大 AI 灾难应对 — flowersslop · 2026-10-09
- Ben Todd 发起讨论:AI 在「技术里氏震级」上该打几分? — ben_j_todd · 2026-10-09
- AI 科学家能压缩假设空间,但绕不开生物学的现实速度 — ingliguori · 2026-10-09
- 2030 年人形机器人先落地工厂与危险环境而非家务 — nikola_mr64990 · 2026-10-09
- Grok 开出意识科学入门书单,聚焦实证研究 — dioscuri · 2026-10-09
- 汇丰拟裁减约 70% 英国理财顾问,转向 AI 数字服务 — rohanpaul_ai · 2026-10-09