Snorkel 开放基准资助扩至 3000 万美元,Marin 负责人谈评测之道
dlwh · x · 2026-10-10
Marin 项目负责人 David Hall 在 Frontier Data Summit 炉边谈话中分享基准测试在模型开发中的真实用法:
- 基准通常落在 2x2 矩阵的一格:预训练 vs 后训练、内部研发 vs 对外沟通;大家熟知的 model card evals 只是后训练×对外那一格
- 最好的内部研发评测能在多个规模上工作,从而指导 scaling law,比传统基准出分早数周到数月给出信号
- 预训练阶段主要依赖语料衍生的指标(loss/perplexity),因为今天的基准多为后训练模型设计,训练中模型可能数月得 0 分
同期 Snorkel AI 宣布将 Open Benchmarks Grants 扩大 10 倍至 3000 万美元,支持研究者与开源团队构建评测;已资助/开发 25+ 开放基准(Terminal-Bench、OSWorld 等),指导委员会包括 Chris Ré、Karthik Narasimhan、Ludwig Schmidt 等。
所属事件:Snorkel 开放基准资助扩至 3000 万美元并组建红队(3 条相关)→
「研究」频道最新
- 论文解码 31 万加密推理块,恢复出 367 条隐私与 182 个凭证 — DynamicWebPaige · 2026-10-10
- Fchollet 长文:科学才是最好的递归自我改进系统,进步实为线性 — fchollet · 2026-10-10
- MIT 学者播客谈 AI 冲击数学界:OpenAI 已给出 Navier-Stokes 证明 — JustinMSolomon · 2026-10-10
- DeepSeek-V4 答案随 2 token 注入翻转,NIAH 波动达 40 分 — Francis_YAO_ · 2026-10-10
- Berkeley 迎来新博士后:研究尊重经济激励的 ML 系统 — nhaghtal · 2026-10-10
- GenAI4World workshop 登场 COLM 2026,含演讲与圆桌环节 — m2saxon · 2026-10-10