博主十维实测:DeepSeek V4.1 可靠性较 V4-Pro-0813 大幅提升
teortaxesTex · x · 2026-09-13
博主 @servasyyai 用自建的十维评测对比 DeepSeek V4.1 Flash 与 V4-Pro-0813。V4.1 在该评测中的可靠性较 V4-Pro-0813 明显改善,第二轮 pass 成绩略有提高;而 V4-Pro 因编码项得零分出现崩盘。
此前 DeepSeek V4.1 Flash 发布时宣称超过 Claude Fable 5.1、仅次于 GPT 6.0 Astra,这组第三方实测为其宣传口径提供了独立参照。
「模型」频道最新
- Reddit 用户吐槽 OpenAI 连折扣百分比都算不对 — nutinahut · 2026-09-13
- OpenMed 宣言:强大智能不能掌握在少数人手里,开源 AI 必须赢 — MaziyarPanahi · 2026-09-13
- 数学家用 Codex 攻克 Navier–Stokes,OpenAI 88 小时后也解出,隐私引质疑 — rubenhassid · 2026-09-13
- 爆料称 X 正将 Grok Bots 接入 XChat,可像私信一样对话 — nima_owji · 2026-09-13
- Nex-N2.5 Pro 连续数百步通关宝可梦,超越单次 computer-use 演示 — alifcoder · 2026-09-13
- 博主称微调开源模型成本仅前沿模型5%,大厂护城河崩塌 — ayushtweetshere · 2026-09-13