开发者实测吐槽:DeepSeek V4 Flash 实际编程体验远不及跑分
adellknudsen · reddit · 2026-08-01
一位开发者在 Reddit 发文表达对 DeepSeek V4 Flash 模型的失望。他指出,尽管该模型在各类基准测试中分数极高,但在实际的 C/C++ 复杂编程任务中表现糟糕,甚至无法完成简单的 Playwright 自动化脚本。
作者认为,目前 AI 圈流行的“单文件 HTML 3D 演示”正在沦为制造噱头的视觉标准,但这些公开代码很可能已被模型用于训练。他呼吁社区建立动态的、未知的基准测试系统,以防止开源模型在刷榜的歧途上越走越远。此外,他反驳了“便宜模型多试几次就能省钱”的观点,认为这会极大浪费开发者的时间。
「编程与Agent」频道最新
- Netlify 发起 8 月 AI 编程挑战:31 天用 AI 交付 31 个教学应用 — thisiskp_ · 2026-08-02
- AI代码能力颠覆复古模拟器,硬核玩家圈却视而不见 — yacineMTB · 2026-08-02
- Awesome AI Hardware 开源项目库:汇集 AI 与硬件结合的可复现方案 — sujingshen · 2026-08-02
- GPT与Claude的最佳用法:PM型与工程师型工作流差异 — brandon_galang · 2026-08-02
- ChatGPT 桌面版新增代码库安全扫描功能 — testingcatalog · 2026-08-02
- AI Agent 彻夜自建单节点 Spark 集群 — andrewchen · 2026-08-02