Gemini 3.8 Flash 以 73.8% 险胜 Astra 的 73.3%,登顶 DeepSWE
jon_barron · x · 2026-09-04
转发 @theo 的对比:Gemini 3.8 Flash 在 DeepSWE 编码基准上拿到 73.8%,以 0.5 个百分点微弱优势超过 Astra 的 73.3%。
「模型」频道最新
- Deep Learning Weekly 第471期:Claude Fable 5.1 发布与生产级 LLM 评测 — dl_weekly · 2026-09-05
- OpenAI 官员确认:Astra 纳入套餐正常用量,额度可 100% 划拨 — soumitrashukla9 · 2026-09-05
- 罕见病诊断基准 RareBench 横评:Claude Fable 5.1 居首,Nemotron 3 Ultra 得 0 分 — danielmckinn0n · 2026-09-05
- 曝 GPT-6 Astra 数学评测超闭源对手,爆料人称开源模型 18 个月内难企及 — inductionheads · 2026-09-05
- TheZvi 解读 Claude Fable 5.1 系统卡:200+ 页安全评估要点 — TheZvi · 2026-09-05
- COLM 论文:思维链看着可读不等于真的重要 — LauraRuis · 2026-09-05