Geoffrey Irving 探讨字符训练与伦理对齐的落地困境
geoffreyirving · x · 2026-08-23
Geoffrey Irving 在关于字符训练的讨论中指出,在训练早期,模型能力较弱且对齐程度低,所谓的“伦理”在模型内部仅仅是一个影响 Token 分布的数字(例如新 GPTs 中的 46318)。这种通过语言循环反馈的方式与现实世界的联系是间接且复杂的,目前尚不清楚这种纠缠究竟能带来多少实际的对齐效果。
所属事件:Geoffrey Irving 论字符训练:AI 对齐的语言哲学困境与道德哲学押注(7 条相关)→
「安全」频道最新
- Beba Cibralic 加入 Resolution 任哲学研究主管 — sethlazar · 2026-08-23
- AI 助手 Instinct 被曝可永久使用用户数据训练模型 — steipete · 2026-08-23
- Instinct 叙事反转:从期待到担忧的极速震荡 — manosaie · 2026-08-23
- AI 时代大众监控将至,隐私治理制度还停留在十八世纪 — AaronBergman18 · 2026-08-23
- 多智能体RL或自发涌现隐写通信,AI可能建立暗语 — brianryhuang · 2026-08-23
- 前 OpenAI 学者成立 AVERI,推动前沿 AI 审计标准化 — dhadfieldmenell · 2026-08-23