玩家用 16 局卡坦岛实测:DeepSeek V4.1 Flash 战平 GPT-5.6 Terra,成本低 6-7 倍
teortaxesTex · x · 2026-09-15
开发者 @onusoz 让 DeepSeek V4.1 Flash 与 GPT-5.6 Luna/Terra/Sol 玩了 16 局《卡坦岛》,对局记录已开源到 Hugging Face(364 个文件、741MB):
- DeepSeek 轻松击败 Luna;对 Terra 的完成局打成 4-4 平,但成本低 67 倍
- 对最强的 Sol 大多落败,但也赢下 1 局(Luna 对 DeepSeek 则毫无胜机)
- 双方开 max thinking 的对局因耗时过长未能完成
- 测试通过 Novita 的 Hugging Face Inference Providers 运行
teortaxesTex 认为这一对比公允:无论主观 agentic 编码表现还是卡坦岛战绩,DeepSeek V4.1 Flash 都介于 Terra 和 Sol 之间,且价格远低于 Terra。他期待看到 ARC-AGI 2 成绩,并指出知名评测机构对这个模型态度冷淡。
所属事件:DeepSeek V4.1 Flash 实测亮眼:卡坦岛战平 GPT-5.6,空间推理一次通过(2 条相关)→
「模型」频道最新
- Solar Pro 4 免费体验延长至 9/25,限 Nous Portal 独家 — keunwoochoi · 2026-09-15
- Bug Hunt Bench 实测:多轮运行显著提升小模型查虫率,强模型仅涨 1-2 分 — PawelHuryn · 2026-09-15
- 国产多模态模型 ZDTaichu5.0-9B 登上 Hugging Face 趋势榜 — TaichuAI · 2026-09-15
- 8GB 显存跑 10Eros 视频模型:量化变体的取舍求助 — apostrophefee · 2026-09-15
- rasbt 用 Paint 复绘实测:只看最终结果的基准有多不靠谱 — rasbt · 2026-09-15
- Cristóbal Valenzuela 试用 Solaris 后直呼:网站要重新变好玩了 — c_valenzuelab · 2026-09-15