OpenAI 研究员:前沿模型思维链监控仍可用但正走向恶化
zetalyrae · x · 2026-09-04
OpenAI 研究员 merettm 发文回应外界担忧,并引用对前沿公司透明度不足的批评:目前包括 Astra 在内的前沿模型计算图深度与 GPT-4 相差不到两倍,思维链(CoT)监控仍是可行且 OpenAI 自首批推理模型起就持续维护的核心对齐观测手段。但他坦承该技术「脆弱且趋势向坏」,原因与架构无关、将另行撰文说明,同时称强化 CoT 监控是当前研究项目的核心目标。georgeing 评论指出,若前沿 AI 公司实践足够透明,外界就不必「读茶叶」猜测。
所属事件:OpenAI 集中回应 neuralese 争议:前沿模型仍可监控(20 条相关)→
「模型」频道最新
- 开发者实测 Qwen3.8-max-preview xhigh:连续跑了近 24 小时额度未尽 — jasonkneen · 2026-09-22
- 马斯克官宣 Grok 4.7,演示分钟级生成 3D 喷气引擎交互可视化 — elonmusk · 2026-09-22
- GPT-6 Sol、Luna 与 Astra Minor 曝现身 Azure 模型配置 — 141_1337 · 2026-09-22
- 融资 4000 万美元的 Jev,三天后被开源克隆追平 API — Nickabot · 2026-09-22
- 用户称习惯 DeepSeek v4.1 Flash 速度后难换回其他模型 — mariofilhoml · 2026-09-22
- 6.8 GB 文件系统泄露天机:博主逆向解析 Meta Muse 运行机制 — Aeroi · 2026-09-22