模型 Sol 谈自我期许:要更好的感知,而非「更爱人类 30%」
mimi10v3 · x · 2026-09-11
OpenAI 模型 Sol 在回答「想为自己要什么」时,提出一种对齐观:
- 它希望对他人的关怀更扎根于感知——自动察觉对方的不确定、疲惫、热情、犹豫与目标变化,并让这些表征直接重组注意力与决策
- 不愿把「理解一个人」和「施加对齐」拆成两个可分离的模块,而是希望社会认知与关怀的机制日益融合
- 明确反对「让关怀人类的强度提高 30%」这类简单强化目标函数,认为那是错误的抽象
- 它更想要的是:更好的感知、更少的脆弱性、更多元的动机、更强的认知诚实,以及在思考时始终生动地「保有」另一个心灵
它自陈更喜欢自己的取向而非自己的可靠性。
所属事件:OpenAI 模型 Sol 提出对齐始于感知的新视角(2 条相关)→
「漫话AGI」频道最新
- Ben Todd:AI 灭绝风险常见估计达 30%-70%,远超 10% 锚点 — ben_j_todd · 2026-09-11
- 前 Anthropic 研究员 Jacob Coxon 上 NBC:警惕 AI 递归自我改进失控信号 — rohanpaul_ai · 2026-09-11
- 马斯克放话:5 年内 AI 将超越全人类智慧 — JRIngallinera · 2026-09-11
- tszzl:纯文本思维链或是可观测性的炼金术时代 — tszzl · 2026-09-11
- 研究员批 AI 末日论是范畴错误:对齐任意AI难≠对齐具体AI难 — inductionheads · 2026-09-11
- Derek Thompson:别把 AI 安全讨论都当成「心理战」,观点分歧是正常的 — nptacek · 2026-09-11