博主吐槽基准图表"造假":DeepSeek V4.1 得分竟低于 DeepSWE
teortaxesTex · x · 2026-09-11
teortaxesTex 嘲讽某博客的 TerminalBench 4.0 图表 "chart crime":图中显示的 TerminalBench 4.0 与 DeepSWE 分数竟然比 DeepSeek V4.1 还低。引用帖指出原博客截图有裁剪问题,并给出完整原图链接。围绕 DeepSeek 新模型基准呈现方式的争议讨论。
「模型」频道最新
- 前 OpenAI 员工断言:前沿模型都在拿成功对话免费微调 — burkov · 2026-09-11
- Teknium 称 DeepSeek Flash V4.1 上线 Hermes Agent(未证实) — Teknium · 2026-09-11
- OpenAI 数学突破遭默认质疑,被指「偷工作成果」 — SGC-UNIT-555 · 2026-09-11
- 传 OpenAI 接近验证 Hodge 猜想证明,千禧年难题再被 AI 破解 — TheGoldenLeaper · 2026-09-11
- Goodfire 在 Llama 3.1 8B 中发现操控流形的通用加法模块 — burny_tech · 2026-09-11
- DeepSeek V4.1 Flash 定价被指离谱,开发者感叹智能便宜到用不完 — ericwdolan · 2026-09-11