DeepSeek V4.1 Flash 一把过空间推理测试,前版 ARC-2 已达 61%
teortaxesTex · x · 2026-09-15
有用户实测 DeepSeek V4.1 Flash 的空间推理与状态追踪能力:让它 one-shot 用 Three.js 构建一个魔方、求解、打乱再继续求解,模型一次通过,表现出色。
teortaxesTex 评论称,这让它很有希望刷好 ARC-2 谜题——上一代 Flash-0731 在 ARC-2 已拿到 61%,而当时的多模态还是较粗糙的非原生方案。不过他也提到该模型在 CritPt 等基准上出现了奇怪的回退,并 @arcprize 呼吁关注。结合前一条卡坦岛实测,社区普遍认为这个模型介于 GPT-5.6 Terra 和 Sol 之间而成本远低。
所属事件:DeepSeek V4.1 Flash 实测亮眼:卡坦岛战平 GPT-5.6,空间推理一次通过(2 条相关)→
「模型」频道最新
- 多名用户称已被路由到 GPT-6 Sol,初评反馈一致看好 — kimmonismus · 2026-09-15
- Claude Fable 5.1 卫冕榜首:百万 token 输入,60 余项规格全解析 — DeepLearningAI · 2026-09-15
- 实测:OpenAI 未调整 Codex 额度,单周期 Astra 用量超 8 亿 token — daniel_mac8 · 2026-09-15
- AlphaSense 实测:Fable 金融研究评分领先,配对分析仅与 Opus-5 打平 — CShorten30 · 2026-09-15
- 爆料:xAI 或今日发布 Grok 4.7,此前多次跳票 — mark_k · 2026-09-15
- 曝 OpenAI 或近期发布 GPT-6 Sol 与 Luna 双版本 — soumitrashukla9 · 2026-09-15