测试框架决定模型成绩:DeepSeek V4 Flash 实测引争议

PMinervini · x · 2026-08-03

开发者指出,评估 DeepSeek V4 Flash 时切勿仅凭单一测试框架下定论。在 Pi、Claude Code 和 OpenCode 等不同工具的实测中,该模型表现出了截然不同的结果,其中 OpenCode 甚至彻底改变了开发者对模型的最终评价。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →