评测已死?数据厂商可用合成环境刷半私有基准
xeophon · x · 2026-08-19
@xeophon 发表对评测生态的判断:半私有评测(semi-private evals)和带保留集(holdout set)的评测「基本已死」——因为数据厂商可以构建合成环境来针对性爬坡(hillclimb)刷分。他认为未来只剩两种可行路线:完全开源的评测(如 MazeBench)或纯内部评测(如 Cursorbench)。这一观点直指当前 benchmark 被针对性优化的污染问题。
「模型」频道最新
- 吐槽:若想赚钱,大厂应重开 Opus 3 和 GPT-4 — natesiggard · 2026-08-19
- Qwen 72B 模型打破算力性价比魔咒,重塑消费级硬件预期 — Hesamation · 2026-08-19
- Nori V1 开源:30M 参数零样本跑赢 XGBoost — rohanpaul_ai · 2026-08-19
- 基于 20 万数据训练的开源情感分类模型发布 — soumitrashukla9 · 2026-08-19
- 知名学者用未解猜想测各家 AI:一致承认一般性证明仍是开放问题 — lemire · 2026-08-19
- 让 Claude 总结代码库,总结本身却需先完全读懂库 — cjimti · 2026-08-19