Redwood 报告:填充无意义 token 大幅提升 GPT-6 推理

Redwood Research 发布评测报告,发现在 GPT-6 Astra 的问题后附加大量无意义填充 token(如一串省略号)并要求直接作答时,其四跳推理准确率从 10% 飙升至约 50%,而其他受测模型几乎无反应。研究认为这揭示了模型可能利用填充 token 进行隐藏计算,意味着对思维链的监测手段可能因此失效。

2026-09-25 ~ 2026-09-26 · 2 条相关