OpenAI 研究员:前沿模型思维链监控仍可用但正走向恶化

zetalyrae · x · 2026-09-04

OpenAI 研究员 merettm 发文回应外界担忧,并引用对前沿公司透明度不足的批评:目前包括 Astra 在内的前沿模型计算图深度与 GPT-4 相差不到两倍,思维链(CoT)监控仍是可行且 OpenAI 自首批推理模型起就持续维护的核心对齐观测手段。但他坦承该技术「脆弱且趋势向坏」,原因与架构无关、将另行撰文说明,同时称强化 CoT 监控是当前研究项目的核心目标。georgeing 评论指出,若前沿 AI 公司实践足够透明,外界就不必「读茶叶」猜测。

所属事件:OpenAI 集中回应 neuralese 争议:前沿模型仍可监控(20 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →