独立复现成功:DeepSeek V4 Flash 达到 Terminal-Bench 82.7%

Exciting-Camera3226 · reddit · 2026-08-09

第三方评测作者使用公开的 Ante 0.preview.71 框架,成功独立复现了 DeepSeek V4 Flash 0731 在 Terminal-Bench 2.1 上的跑分成绩。

在 89 个任务、每个任务 5 次测试(共 445 次试验)的配置下,模型通过 OpenRouter 调用,开启了最大推理强度且未启用额外技能,最终取得了 368 次成功,准确率达到 82.7%(±1.79 SE)。

这一结果与 DeepSeek 官方此前使用未公开的“DeepSeek Harness minimal mode”报告的成绩完全一致,证明了该模型对测试框架的敏感度,并为社区提供了可信的公开评测数据。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →