DeepSeek V4 Flash vs Pro 实测:小模型找 Bug 全中,大模型信息量高 2.4 倍
TheDeepArchive · reddit · 2026-08-13
测试背景与方法
开发者针对 DeepSeek V4 Flash (0731) 和 DeepSeek V4 Pro (0813) 构建了严格的基准测试,在真实的 Python+PySide6 桌面应用代码库上对比二者的代码分析能力。
测试涵盖 6 类任务:架构审查、事实流追踪、真实 Bug 查找、重构计划、指令冲突测试和影响分析。共进行 18 次运行,提取了 239 个原子声明,并由第三方模型(Qwen 3.7 Plus)独立验证。
核心结论
- 事实准确性:两者准确率接近,Pro 为 95.9%,Flash 为 95.7%。Pro 几乎没有硬性事实错误。
- 输出信息量:Pro 输出量极大,验证声明达 169 个(比 Flash 多 2.4 倍)。
- Bug 查找能力:Flash 表现惊人,找出了全部 3 个已知潜在 Bug;而 Pro 仅找到 1 个。
- 一致性:Pro 的运行间一致性较低,深度波动约 2.7 倍。
「编程与Agent」频道最新
- Grok 4.6 发布 48 小时:10 个惊艳的代码与 3D 生成实测 — minchoi · 2026-08-13
- 微软新论文揭示:Agent技能库并非免费,错误指导暗藏高昂代价 — omarsar0 · 2026-08-13
- 别等更强模型了!Agent可靠性困境的破局之道在于架构设计 — import_jmr · 2026-08-13
- NVIDIA免费开放7门AI课程,涵盖Agentic AI与机器人 — ifioknkem · 2026-08-13
- Claude Code 的 harness 让几乎所有事情变得更糟? — aiamblichus · 2026-08-13
- brawsr 发布:支持浏览器 Agent 状态存档与分支并行 — NoFlounder9565 · 2026-08-13