研究者吐槽:真强者应是「评测全崩但坚称榜单是垃圾」的模型
ryunuck · x · 2026-10-07
作者提出一个反直觉观点:真正的强大模型,应该是一个不刷爆任何 benchmark、作者还在 Twitter 上坚决回击、声称「你们的评测都是垃圾」的模型。
这讽刺了当前 AI 圈过度依赖公开榜单的评测文化——当所有实验室都围绕同一批 benchmark 优化时,榜单成绩与真实能力可能已经脱节。作者期待的信号是模型强到让现有评测体系失效,而非在现有体系里拿高分。
「模型」频道最新
- SciCode 基准被指过时:>90% 通过率已难反映前沿 — geoffwolfe · 2026-10-08
- 同款模型表现迥异:Dylan Patel 谈 harness 如何改变 AI 性能 — MatthewBerman · 2026-10-08
- Unsloth 用 4GB 显存把 Qwen3.5 0.8B 决策准确率从 20.7% 提到 74.3% — kalyan_kpl · 2026-10-08
- 「速度狂热该停了」:开发者吐槽模型一味冲 tokens/s 牺牲质量 — casper_hansen_ · 2026-10-08
- 9B 索引配 0.6B 查询:pplx-embed-v2 同嵌入空间实现跨模型检索 — antoine_chaffin · 2026-10-08
- 0.6B 视觉检索模型媲美 8B 级对手,文档检索不牺牲图像搜索 — antoine_chaffin · 2026-10-08