研究者驳斥 ARC-AGI 独家论:多数基准测试均能体现思维模型能力跃升
scaling01 · x · 2026-08-13
作者针对 ARC-AGI 官方宣称其测试能捕捉其他基准无法衡量之能力的说法提出异议。指出在大多数数学和长上下文基准测试(以及 LisanBench)中,从非思维模型(non-thinking)向思维模型的转变同样能展现出这种能力过渡。
「模型」频道最新
- DeepSeek 新开源项目两小时斩获 3.3 万星 — MaziyarPanahi · 2026-08-14
- 自建 Agent 实测:GLM-5.2 综合最佳,DeepSeek Flash 性价比极高 — codes_astro · 2026-08-14
- DeepSeek V4 Flash 成本极低,让全民普及 AI 智能体成为可能 — Teknium · 2026-08-14
- DeepSeek 发布 V4 Pro 并开源 Agent 软件 — The Decoder · 2026-08-14
- DeepSeek疑似推出深度研究功能 — teortaxesTex · 2026-08-14
- Grok 4.6 修复 React 代码能力出色,登顶 ReactBench 第二名 — aidenybai · 2026-08-14