开发者吐槽 DeepSeek 新模型刷榜强实际体验差

开发者 Bindu Reddy 公开吐槽 DeepSeek 是「刷 benchmark 之王」,指其最新 Flash 模型宣称可媲美 Fable 和 Astra 等模型,但任何人实际使用两分钟就会发现体验远不如宣传,跑分亮眼与实际表现存在明显落差。该观点在社区引发讨论,再次引发对大模型评测分数与真实能力是否相符的质疑。

2026-09-27 ~ 2026-09-27 · 2 条相关