antirez:编码评测基准多是「垃圾」,与训练实际能力严重脱节
antirez · x · 2026-09-03
Redis 作者 antirez 发推指出,模型在训练过程中取得的进展,与后来用于评测的基准关系很小;他判断每家大型 AI 实验室都有一套私有的内部基准,用于真正衡量模型是否变强。
他建议去打开各大实验室使用的顶级编码评测基准亲自看看:「大多是垃圾」,主要在考验工具调用,以及 C++、Python 等语言之间的摩擦,而非真实世界中的模型行为。
所属事件:antirez 炮轰编码评测基准质量低劣(2 条相关)→
「模型」频道最新
- Claude Fable 5.1 高配版以 92.3% 刷新 WeirdML 评测 SOTA — teortaxesTex · 2026-09-03
- 分析称 OpenAI 若在 Astra 上用 Looped Transformer,必已验证可扩展 — teortaxesTex · 2026-09-03
- 企业宁多付数倍用 token 计费,数据保留担忧让 AI 订阅折扣失灵 — random_walker · 2026-09-03
- 阿里云联合 Hermes 办 200+ 人活动,展示 Qwen 3.8 全系模型 — Teknium · 2026-09-03
- 3595 条回复复测 15 个模型:上次的两条爆点结论全部翻车 — nejcar20 · 2026-09-03
- Astra 在 ExploitBench 拿满分,官方自建变体重测漏洞利用能力 — inductionheads · 2026-09-03