RareBench 实测:Gemini 3.7 Flash 大跃升,DeepSeek Pro 未见提升
danielmckinn0n · x · 2026-08-18
Gamowlabs 发布 RareBench(罕见病基因组建学基准)博客文章,论文与数据即将放出,要点:
- Gemini 3.7 Flash 相比 3.6 Flash 是巨大飞跃,若能把图中的黄色项翻成绿色,就接近「又快又(相对)便宜」的 SOTA。作者还表示在基因组学研究的交互式场景中很喜欢这个模型——在该领域足够聪明,速度显著加快了在线假设生成。
- DeepSeek Pro 的结果得到确认:尽管舆论普遍认为该模型是重大飞跃,但 RareBench 上相比 Flash 没有提升。
「模型」频道最新
- 社区免费开放 Qwen3.8-27B API,至少维护到八月底 — ProfessionalHorse707 · 2026-08-18
- Qwen3.8-27B 在 Agentic Index 上反超 Opus 5 Medium — secopsml · 2026-08-18
- Qwen3.8-27B FP8 还是 BF16?长程智能体任务量化精度实测讨论 — Ambitious_Fold_2874 · 2026-08-18
- 求 Qwen 3.8 27B 多种量化版的基准测试对比 — Additional-Ordinary2 · 2026-08-18
- Grok 4.6 编码实测:搞定复杂逻辑但系统性遗漏基础 — mark_k · 2026-08-18
- Qwen3.8-27B 基准测试与 DeepSeek V4、GPT-5.6 Luna Max 并驾齐驱 — anderspitman · 2026-08-18