Albanie:模型无思维链任务时长大幅跳升
SamuelAlbanie · x · 2026-09-04
DeepMind 研究员 Samuel Albanie 转发 METR 风格的任务时长评测图,指出模型在不使用思维链(no-CoT)条件下的可完成任务时长出现「quite a big jump」,即模型能独立完成任务的持续时间显著增长,是能力趋势的重要信号。
所属事件:DeepMind 研究员:模型无思维链时间视野大幅跃升(3 条相关)→
「模型」频道最新
- OpenAI–Hugging Face 事件本质是网络安全架构失守而非 AI 问题 — AlexTensor · 2026-09-04
- GPT-6 Astra 登顶代码迁移基准,68% 准确率领先第二名 10 分 — sandersted · 2026-09-04
- OpenAI 发布 GPT-6 Astra:电脑上能做的事它都能替你做 — astralmatrix · 2026-09-04
- 吴恩达调侃前沿模型太弱:来跟我聊聊,问题会让它们宕机 — andrewgwils · 2026-09-04
- Epoch AI 发布 FrontierMath Erdős 基准,Astra 以 2/68 居首 — keviv9 · 2026-09-04
- OpenAI 发布 GPT-6 Astra:ARC-AGI-3 得 99.9%,但独立评测泼冷水 — Latent Space · 2026-09-04