Snorkel 设 300 万美元开放基准资助,资助 Terminal-Bench 等智能体评测
typewriters · x · 2026-09-25
Snorkel AI 的 vincentsunnchen 转发 Logan Graham「AI 产品公司应花 25% 以上时间做基准并推动模型实验室重视」的观点,介绍其 Open Benchmarks Grants 计划:300 万美元资助开源数据集、基准与评测产物,滚动接受申请。
- 好基准需要:明确测什么能力、为何该进 model card 的论题,加上方法学与任务级严格性(专家与程序化质检)
- 已支持案例:Terminal-Bench 4.0(校准任务资源、移除饱和任务)、Terminal-Bench-Science(科学家定标准)、Senior SWE-bench(资深级工程工作评测)、Agent's Last Exam 等
- 框架主张基准须沿环境复杂度、自主时间跨度、输出复杂度三个维度逼近真实场景
「编程与Agent」频道最新
- Anthropic 工程师征询后拟砍 Plan Mode,改为 Shift+Tab 调节推理力度 — trq212 · 2026-09-25
- Plan Mode 改造细节曝光:可自定义提示词、自建模式、重绑热键 — trq212 · 2026-09-25
- Firecrawl 获 7500 万美元 B 轮融资,目标 50 人内做到 1 亿美元 ARR — devdigest · 2026-09-25
- Hill Sampling:以最佳已验证解为条件并行生成 512 个编辑迭代优化 — LChoshen · 2026-09-25
- Nat Friedman 回应泄密质疑:Verge 报道的是用户 VM 文件,本属预期行为 — dtrinh · 2026-09-25
- ServingStudio 发布:先仿真再上真机,省下昂贵的 GPU 试错成本 — bariskasikci · 2026-09-25