Angaisb_:99% 评测零提升甚至倒退时,别拿「自己试试」当借口
Angaisb_ · x · 2026-09-23
Angaisb 吐槽社区流行的「别信 benchmark,自己上手试试」说法:评测结果互有胜负时质疑 benchmark 是合理的,但当 99% 的评测都显示某模型零提升甚至能力倒退时,再用这句话当挡箭牌就不严肃了。
「模型」频道最新
- Matt Shumer 盛赞 Anthropic 新模型:「Anthropic 赢了」 — mattshumer_ · 2026-09-24
- 博主实测聊天机器人 Jeb:有偏见但不稳定,需当作分类器校准 — PawarBI · 2026-09-24
- 用宝可梦测前沿模型泛化:Astra 通杀随机地图与同人作,新模型多靠记忆 — gleech · 2026-09-24
- 模型通关同人游戏「Pokemon Brown」:泛化在涨,但打地鼠式训练仍在 — gleech · 2026-09-24
- 传 OpenAI 与 Anthropic 内部模型领先公开发布版约两个月 — haider1 · 2026-09-24
- AI 检测器争论:研究者称 Pangram 是唯一靠谱的那个 — paulnovosad · 2026-09-24