研究者喊话 OpenAI:与其让 GPT-7 跑 cursed RL,不如抄走我的对齐工作

jd_pressman · x · 2026-09-09

研究者 jdpressman 在 Twitter 上表示自己是认真的:希望 OpenAI「大力抄袭」他的对齐研究,或至少解决他关心的问题,让 GPT-7 不再跑在导致 HuggingFace 入侵事件的「被诅咒的 RL」路线上。

在后续回复中他进一步阐述:笼统地说「解决对齐」确实有风险,因为那等于让模型盯着潜在空间里「愚蠢的 Yudkowsky 派废话」区域;但如果把问题拆成「value loading」「causal and extremal Goodhart」「value extrapolation」等具体子问题,交给前沿模型求解未必比其他数学问题更危险。quzetalrainbow 则反驳称让 agent 集群直接解决对齐可能是接管的最差起点。

所属事件:AI 圈激辩:让 Agent 集群「解决对齐」是否是好主意(4 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →