研究者质疑「先发布再改进」式指标爬坡是否有意义
suchenzang · x · 2026-10-11
AI 研究者 Su Chenzang 发文嘲讽行业里「先发布、再改进」的做法,并质疑被拿来优化爬坡的某项指标本身是否真的值得作为目标:能力到底如何没人说得清,先把版本放出去再说。
这种表态折射出当前模型评测文化的一个普遍问题——榜单数字被当成营销工具,而非真实能力的度量。
「模型」频道最新
- Anthropic 向用户发放 Claude API Credits — daluoseo · 2026-10-11
- 开发者吐槽:OpenAI 员工活跃但产品疑询数月无人答 — Angaisb_ · 2026-10-11
- 模型够聪明之后,"品味"将成选择 AI 的第一标准 — DynaBeast · 2026-10-11
- 研究者吐槽 Copilot Premium:数据分析要靠长篇哄劝才肯配合 — lescarr · 2026-10-11
- Odyssey 发布 140 亿参数世界模型 Odyssey-3,可免费试用 — The Decoder · 2026-10-11
- Berkeley 演讲:推理有结构,置信度可控可省 25% 思考 token — datawithsuman · 2026-10-11