一串省略号让 GPT-6 四跳推理从 10% 飙到 50%,Redwood 报告揭示隐藏算力
新智元 · wechat · 2026-09-25
Redwood Research 最新报告发现,在 GPT-6 Astra 的问题后面加一串毫无意义的句点(填充 token),能大幅提升其推理表现,而其他受测模型几乎无反应。
- 关键实验:在四跳串行推理任务上,Astra 准确率从约 10% 升至约 50%;修改过的旧 AIME 数学题从约 60% 升至约 90%。对照组 Opus4.5、Opus5、GPT-5.6-Sol 对填充几乎无反应(统计上 GPT-5.6-Sol 有微弱提升)。
- 细节:收益在约 8192 填充 token 附近达到峰值;填充放在题目之后有效、之前无效;数数、重复题目等填充方式效果类似。
- 实验设置:API 报告推理 token 为零,使用低强度推理并要求直接回答——但这只说明接口记录为零,无法证明模型内部没有额外计算。
- 安全含义:真正的担忧是思维链监控——若模型大量计算无需写成文字,检查其推理文本的安全监控思路就可能漏掉重要内容;只测「直接回答」也会低估模型的无 CoT 能力。团队建议未来无推理评测加入填充 token 测试。
所属事件:Redwood 报告:填充无意义 token 大幅提升 GPT-6 推理(2 条相关)→
「模型」频道最新
- Codex 宕机,OpenAI 称正加急恢复服务 — prd_008 · 2026-09-26
- Polymarket 快讯:ChatGPT 正遭遇重大服务中断 — Polymarket · 2026-09-26
- 更多用户报告 Codex 无法使用,附错误截图 — hugobowne · 2026-09-26
- Codex 宕机,用户涌向高管喊话求重置额度 — rudrank · 2026-09-26
- 用户吐槽 Anthropic:「修复体验」的新功能反从周额度里扣费 — gerardsans · 2026-09-26
- Codex 现服务中断,网友劝用户出门散步 — TheMoonMidas · 2026-09-26