Snorkel AI 加场直播:基准测试在模型开发中的真实用法与局限
dlwh · x · 2026-10-09
Snorkel AI 临时增加一场直播,主题是「基准测试如今在模型开发中如何被使用、又如何没有被使用」,嘉宾包括 Laude Institute 的 Braden Hancock 与 Marin/Open Athena 的 dlwh。
讨论将围绕几个新基准展开:Terminal-Bench Science、JudgmentBench 与 SlopCodeBench,参与者还有 Steven Dillmann、Russell Yang、GOrlanski、vincentsunnchen 等人。
「研究」频道最新
- Salesforce 提出 SRD 蒸馏后见之明,2B 模型成功率从 0 到 60.6% — Salesforce · 2026-10-09
- Claude 声称发现 500 光年外一对红矮星双星系统 — nitarshan · 2026-10-09
- Prompt tuning 被集体遗忘,微调 token 或被严重低估 — cephaloform · 2026-10-09
- Baeza-Yates 演讲:机器学习模型评估何时能不再自欺 — PolarBearby · 2026-10-09
- 阿尔茨海默病翻译挑战赛启动:1.5 亿细胞图谱开放给 AI 研究者 — xeophon · 2026-10-09
- 换 harness 不换模型,GPT-5.6 仓库迁移成绩从 6.5% 飙到 31% — omarsar0 · 2026-10-09