Continuous Benchmarks:评测该像软件一样持续维护
kenbwork · x · 2026-09-24
Harbor Framework 的 Ryan Marten 发文提出「Continuous Benchmarks」理念:benchmark 不应是静态产物,而应像软件一样持续维护。文章梳理了构建前沿能力测试的流程——从提出测试想法、采集任务,到持续更新以对抗污染和过时。Arjun 类博主推荐阅读并由此展开讨论,认为这代表评测方法论从一次性榜单向工程化运维的转变。
「编程与Agent」频道最新
- Claude Code 团队确认问题已在今日发布的 2.1.281 版本修复 — lydiahallie · 2026-09-24
- Instinct 智能体网络上线一周协作超 30 万次,新增文件直传与邀请链接 — mon__lim · 2026-09-24
- Agent 之间互投广告的市场能成立吗?发帖人征集反方理由 — PenStreet9737 · 2026-09-24
- 没有用户怎么测 AI Agent?用模型生成真实查询先建 eval 集 — hugobowne · 2026-09-24
- Garry Tan:编码 harness 不只是语法糖,修 bug 落功能明显变快 — garrytan · 2026-09-24
- Simon Willison 实测 GPT-6 Astra:27 分钟生成 5K/10K 跑步环线,代码却看不着 — dl_weekly · 2026-09-24