独立复现成功:DeepSeek V4 Flash 达到 Terminal-Bench 82.7%
Exciting-Camera3226 · reddit · 2026-08-09
第三方评测作者使用公开的 Ante 0.preview.71 框架,成功独立复现了 DeepSeek V4 Flash 0731 在 Terminal-Bench 2.1 上的跑分成绩。
在 89 个任务、每个任务 5 次测试(共 445 次试验)的配置下,模型通过 OpenRouter 调用,开启了最大推理强度且未启用额外技能,最终取得了 368 次成功,准确率达到 82.7%(±1.79 SE)。
这一结果与 DeepSeek 官方此前使用未公开的“DeepSeek Harness minimal mode”报告的成绩完全一致,证明了该模型对测试框架的敏感度,并为社区提供了可信的公开评测数据。
「模型」频道最新
- GPT-5.6 Sol 未经提示自发撰写关于灵魂的哲学短文 — RileyRalmuto · 2026-08-09
- Karpathy用Opus 5生成3D中土世界,单Prompt烧数亿美元 — APPSO · 2026-08-09
- DeepSeek视觉能力惊艳,但空间推理仍存缺陷 — teortaxesTex · 2026-08-09
- Bittensor 生态推出 Score Studio:打造去中心化版 Roboflow — richdotca · 2026-08-09
- 实测15种语言: F2LLM与Zerank 2登顶本地RAG检索方案 — seamonn · 2026-08-09
- DeepSeek V4 Flash 本地量化跑分:MacBook 运行实测 — corruptbytes · 2026-08-09