研究者驳斥 ARC-AGI 独家论:多数基准测试均能体现思维模型能力跃升

scaling01 · x · 2026-08-13

作者针对 ARC-AGI 官方宣称其测试能捕捉其他基准无法衡量之能力的说法提出异议。指出在大多数数学和长上下文基准测试(以及 LisanBench)中,从非思维模型(non-thinking)向思维模型的转变同样能展现出这种能力过渡。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →