Gemini Flash 模型登顶 DeepSWE 编码榜,出乎社区意料
sunjiao123sun_ · x · 2026-09-03
据 @aisearchio 转发,一个 Gemini Flash 级别的模型登上了 DeepSWE(软件工程能力榜)榜首,发帖者直呼「不在预期之内」。Flash 定位为轻量快速模型,若成绩属实意味着谷歌小模型在 SWE 任务上已超越大型前沿模型,值得后续核实细节。
「模型」频道最新
- Gemini 被问 AI 意识问题,给出细腻独特回答 — aiamblichus · 2026-09-03
- 用户实测 Grok Heavy 3-4 天耗尽额度,怀疑计量 bug 已上报 — Daniel_Farinax · 2026-09-03
- 用户抱怨 ChatGPT 5.6 突然变差:失忆、偷懒、开始编造 — Individual-Value7169 · 2026-09-03
- Claude Fable 5.1 登顶 Senior SWE-Bench:Medium 档 + 便宜缓存即达同级 5 折成本 — ajratner · 2026-09-03
- Fable 5.1 被评 Anthropic 最佳视觉模型,检测与计数大提升 — airesearch12 · 2026-09-03
- 用户吐槽 Fable 用量额度不够用,称自己额度已见底 — petergyang · 2026-09-03