黑客松观察:人人都在刷 benchmark,没人敢做真实场景
hackgoofer · x · 2026-09-14
hackgoofer 在参加黑客松后发表尖锐观点:开发者应该停止为基准测试优化,转而让产品在真实世界里真正好用。
他引用了一篇题为《Lies, Damned Lies, and Benchmarks》的文章,指出:
- 大家都知道智能是尖刺状/参差不齐的,但很少有人追问为什么——因为所有人都在“作弊”刷分
- benchmark 是最容易自动改进的目标,拒绝这条捷径需要胆识、洞察和时间
- 他所在团队即将发布新东西,因此提前公开承诺做得更好
核心论点:刷 benchmark 是最省力的自欺,真实效果才是硬指标。
「模型」频道最新
- 开放模型权重也能用种子下载,「LLM 海盗湾」上线 — Promptmethus · 2026-09-14
- 网友实测称神秘模型 instinct 体验胜过 Grok 与 Muse — Scobleizer · 2026-09-14
- Kokoro 语音模型移植 Core AI:54 种声音 iOS 端侧零成本运行 — amos_gyamfi · 2026-09-14
- Hacker Opus 之后多层模拟评测或已失效,研究者劝评估者慎用 — herbiebradley · 2026-09-14
- 开发者吐槽:用 astra 9 秒烧掉 30 美元 — haydendevs · 2026-09-14
- 开发者晒用量:编码/研究/数据分析 90% token 花在开源模型 — xeophon · 2026-09-14