DeepSeek v4.1 flash 在 8 种编码框架实测:极简 harness 表现最佳
mariofilhoml · x · 2026-09-11
DeepSeek 对其新 v4.1 flash 模型在 8 种不同 harness 配置下做了编码评测:模型在极简 harness(mini-SWE 与 DeepSeek 自家极简 harness)中表现最好,在 Claude Code 和 Codex 中反而欠佳。回复者 mariofilhoml 解释:这很可能是 RL 训练时选择了在 DeepSWE 等基准上表现好的 checkpoint 所致,即评测 harness 契合训练选择偏差。
所属事件:DeepSeek 发布 Harness v0.1.5 并评测 V4.1 Flash(3 条相关)→
「编程与Agent」频道最新
- HeyGen 联手 OpenAI 开源实时数字人交互框架 — aftahi_ai · 2026-09-11
- Terminal-Bench 团队将办 meetup,聚焦 RL 环境与 Agent 评测前沿 — simonguozirui · 2026-09-11
- Hermes:跨 Claude、Codex 等多平台编排 agent 的元框架 — intellectronica · 2026-09-11
- ClawBench 在 144 个真实网站测 Agent:最强模型成功率仅 33% — jiqizhixin · 2026-09-11
- UIUC 发布 SREGym:GPT-5.6 Sol 领跑,SRE Agent 端到端解决率仅 81% — tianyin_xu · 2026-09-11
- Credit Genie 用 OpenWiki 存代码库知识,编码 Agent 不再瞎猜 — LangChain · 2026-09-11