DeepSeek V4.1 Flash 实测亮眼:卡坦岛战平 GPT-5.6,空间推理一次通过

用户对 DeepSeek V4.1 Flash 展开多项实测:开发者 @onusoz 让其与 GPT-5.6 Luna/Terra/Sol 进行 16 局《卡坦岛》对局,结果战平,而成本仅为对方的六至七分之一,对局记录已开源到 Hugging Face。另有用户测试其空间推理与状态追踪能力,模型 one-shot 用 Three.js 构建魔方并完成求解、打乱与再求解,一次通过;前代模型在 ARC-2 上已达 61%。

2026-09-15 ~ 2026-09-15 · 2 条相关