真正有用的基准测试,得证明它能预测真实工作
DevToD4 · x · 2026-07-24
一个有价值的 benchmark,首先要证明它配得上被使用。
帖子强调,真正有用的基准测试至少应满足:
- 构念清晰:到底在测什么,必须明确
- 污染审计:要检查训练数据是否泄漏
- 评分稳定:同一能力不应因细微扰动而大幅波动
- 有人类基线:要知道模型离人类实践水平还有多远
- 与真实工作相关:高分应该能预测更好的实际表现
否则,团队只是在把模型优化到一个默认有效、但其实可能并不成立的测试上。
「研究」频道最新
- 新加坡国立大学做出无电子无外部供能软力传感器 — CurieuxExplorer · 2026-07-27
- Chelsea Finn:机器人 RL 的瓶颈是物理 rollout 成本 — ycombinator · 2026-07-27
- ICML 2026 口头论文复现分数重算后仍偏中等 — profjamesevans · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- Seed IQ 在 Doom II 里通关,引出 ARC-AGI 之后的评测问题 — Fit_Transition8824 · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27