开发者实测吐槽:DeepSeek V4 Flash 实际编程体验远不及跑分

adellknudsen · reddit · 2026-08-01

一位开发者在 Reddit 发文表达对 DeepSeek V4 Flash 模型的失望。他指出,尽管该模型在各类基准测试中分数极高,但在实际的 C/C++ 复杂编程任务中表现糟糕,甚至无法完成简单的 Playwright 自动化脚本。

作者认为,目前 AI 圈流行的“单文件 HTML 3D 演示”正在沦为制造噱头的视觉标准,但这些公开代码很可能已被模型用于训练。他呼吁社区建立动态的、未知的基准测试系统,以防止开源模型在刷榜的歧途上越走越远。此外,他反驳了“便宜模型多试几次就能省钱”的观点,认为这会极大浪费开发者的时间。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →