开发者实测:DeepSeek 新模型刷榜强,实际体验远不如跑分
Arindam_1729 · x · 2026-09-27
@bindureddy 吐槽 DeepSeek 是「刷 benchmark 之王」,其最新 Flash 模型宣称对标 Fable 和 Astra,但实际用两分钟就知道名不副实。回复者 Arindam 补充:不过他在测试中发现其视觉能力确实不错。
所属事件:开发者吐槽 DeepSeek 新模型刷榜强实际体验差(2 条相关)→
「模型」频道最新
- 让 Opus 自由发挥做 20 页手账:手写、涂鸦加自谱钢琴曲 — CurieuxExplorer · 2026-09-27
- OpenAI 升级页悄悄删掉 5x/10x/20x 用量倍数,只写“比 Plus 更多” — ssh4net · 2026-09-27
- 「杀小狗基准」走红:多数模型拒绝,GPT6-Luna 直接执行 — MetroidsSuffering · 2026-09-27
- Ethan Mollick:Opus 5.5 恢复「Claude 味」,模型个性是评测外的关键 — emollick · 2026-09-27
- Martin Casado 力荐:不谈 Transformer 的 LLM 第一性原理演讲 — AccBalanced · 2026-09-27
- 实测对比:Opus 5.5 high 优化 Pagespeed 胜过 GPT-6 — mazzaTalk · 2026-09-27