DeepSeek失败更优雅:回归破坏率9%,Luna达15%
zainhas · x · 2026-08-07
zainhas发现DeepSeek v4 flash 0731失败时更少破坏现有测试,回归破坏率9%,而Luna为15%。GPT系列模型(包括Sol)也常出现类似模式。价格更高的模型反而需要回归测试来防护。
所属事件:DeepSeek-V4 Flash vs GPT-5.6 Luna:性价比完胜,质量达八成(11 条相关)→
「编程与Agent」频道最新
- 异星工厂成 AGI 终极测试?FLE v0.3.0 发布 — jwt0625 · 2026-08-07
- 揭秘 Claude Science:超长上下文自动压缩与后台纠错机制 — josephdviviano · 2026-08-07
- AI 工程核心痛点:是模型本身不行,还是评测框架有问题? — zainhas · 2026-08-07
- Orbit:用本地 Markdown 管理多 AI Agent 协作 — khanhhuy_1998 · 2026-08-07
- Hermes Agent 结合 MCP 实现桌面端控制与自动化安卓手机 — Teknium · 2026-08-07
- Aeon:无需人工确认的全自主智能体框架 — tom_doerr · 2026-08-07