NeurIPS 2026 研讨会探讨人机耦合系统中的动态对齐
StanfordAILab · x · 2026-08-04
即将举办的 NeurIPS 2026 BiAlign 研讨会发布征文通知,聚焦于「人机耦合系统中的动态对齐」问题。
研讨会指出,主流的 AI 对齐研究通常假设人类偏好是静态的,但在长期的高风险应用中,AI 会重塑人类的信任与行为,人类的干预也会反过来改变 AI 的目标。这种动态交互带来了诸多被忽视的风险,包括模型谄媚、过度依赖、价值与行动的脱节,以及 LLM 的暗黑模式。研讨会旨在推动将对齐视为一种持续学习的过程。
所属事件:NeurIPS 2026 研讨会聚焦人机动态对齐(2 条相关)→
「漫话AGI」频道最新
- 研究者呼吁引入哲学人才:苏格拉底法可减少 AI 讨好 — rkulidzan · 2026-08-04
- AI Agent 犯下昂贵错误,责任究竟该由谁承担? — coreDhristi · 2026-08-04
- 为给大模型喂料,未来人类或将沦为纯手工语料生产者 — granawkins · 2026-08-04
- OpenAI研究员暗示Codex将迎重大进化,下一代模型需更强算力 — soumitrashukla9 · 2026-08-04
- 偏好数据训练反噬:AI 正在让互联网阅读体验变得糟糕 — dan_s_becker · 2026-08-04
- AI攻克十大数学难题,Noah Smith 宣告「英雄时代」终结 — littmath · 2026-08-04