DeepSeek失败更优雅:回归破坏率9%,Luna达15%

zainhas · x · 2026-08-07

zainhas发现DeepSeek v4 flash 0731失败时更少破坏现有测试,回归破坏率9%,而Luna为15%。GPT系列模型(包括Sol)也常出现类似模式。价格更高的模型反而需要回归测试来防护。

所属事件:DeepSeek-V4 Flash vs GPT-5.6 Luna:性价比完胜,质量达八成(11 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →