OpenAI 员工驳斥神经语谣言,强调链式思维监测重要性
cephaloform · x · 2026-09-02
OpenAI 研究员 Micah Carroll 回应关于 OpenAI 使用“neuralese”(神经语)模型的误解,指出这种误解可能引发“不可监控性竞赛”,后果极其愚蠢。OpenAI 员工 Merettm 进一步澄清,当前前沿模型(包括 Astra)的计算图深度与 GPT-4 相差不到两倍。OpenAI 自首个推理模型以来一直致力于保留和利用思维链(CoT)监测,以此观察模型对齐如何从训练分布泛化,尽管该技术脆弱且有负面趋势,但仍是当前核心研究目标。
所属事件:OpenAI 集中回应 neuralese 争议:前沿模型仍可监控(11 条相关)→
「安全」频道最新
- Scott Alexander 新文:用拟人化模型预测 AI 行为 — repligate · 2026-09-02
- 争议:Anthropic 是否故意让 Claude“错误对齐”? — liminal_bardo · 2026-09-02
- 美国年产 40 个基础模型远超欧盟 3 个,监管被指拖累 — PDXFato · 2026-09-02
- 预测未来一年:机械可解释性监控将超越思维链 — tszzl · 2026-09-02
- Anthropic 上市后如何兼顾使命与股东利益?PBC 结构解析 — max_paperclips · 2026-09-02
- 哈佛学者:CFAA 法案模糊,AI 安全研究员面临起诉风险 — Scobleizer · 2026-09-02