Redwood 实测:Astra 借 filler token 无人化推理,CoT 监测或失效
scaling01 · x · 2026-09-26
Redwood Research 发布评测,研究 GPT-6-Astra 在提示词被填充大量无意义「filler token」(如省略号)且被要求直接作答时的表现。
核心发现:
- 在需要串行认知的「N-hop 自然事实」任务上,Astra 配合 filler token 表现大幅提升:4-hop 推理从约 10-20% 提升到约 50%,且填充至 4096 个 token 时仍持续受益。
- 在老版 AIME 题等通用基准上,filler token 也带来明显提升(约 60-70% 提高到约 90%)。
- 对比测试显示,Opus 4.5、Opus 5、GPT 5.6-Sol、DeepSeek-V3.2 均没有 Astra 这种随 filler token 增多而显著改善的特性。
安全含义:这说明 Astra 能在思维链(CoT)之外执行大量未言明的认知过程,意味着基于 CoT 的模型行为监测(monitorability)可能失效,是一个值得警惕的能力信号。
所属事件:Redwood 报告:填充无意义 token 大幅提升 GPT-6 推理(2 条相关)→
「研究」频道最新
- AI 时代该废除双盲评审吗?公开评审系统的利弊之争 — Temporary_Switch_339 · 2026-09-26
- Jev-Mem 架构让 Agent 记忆构建快 6.6 倍,查询延迟降 36.7% — omarsar0 · 2026-09-26
- 跨域类比法提升 LLM 创造力获 NeurIPS 2026 接收 — james_y_zou · 2026-09-26
- Nayebi 谈 AI 智能体目标生成:除自主设定目标外,多数难题可被工程解决 — aran_nayebi · 2026-09-26
- 致敬 Google 蚂蚁挑战赛,小型神经网络下棋平台上线 — codetiger42 · 2026-09-26
- ACuRL:零人类数据让计算机使用智能体持续适应环境 — ysu_nlp · 2026-09-26