DeepSeek V4.1 Flash 一把过空间推理测试,前版 ARC-2 已达 61%

teortaxesTex · x · 2026-09-15

有用户实测 DeepSeek V4.1 Flash 的空间推理与状态追踪能力:让它 one-shot 用 Three.js 构建一个魔方、求解、打乱再继续求解,模型一次通过,表现出色。

teortaxesTex 评论称,这让它很有希望刷好 ARC-2 谜题——上一代 Flash-0731 在 ARC-2 已拿到 61%,而当时的多模态还是较粗糙的非原生方案。不过他也提到该模型在 CritPt 等基准上出现了奇怪的回退,并 @arcprize 呼吁关注。结合前一条卡坦岛实测,社区普遍认为这个模型介于 GPT-5.6 Terra 和 Sol 之间而成本远低。

所属事件:DeepSeek V4.1 Flash 实测亮眼:卡坦岛战平 GPT-5.6,空间推理一次通过(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →