Snorkel AI 加场直播:基准测试在模型开发中的真实用法与局限

dlwh · x · 2026-10-09

Snorkel AI 临时增加一场直播,主题是「基准测试如今在模型开发中如何被使用、又如何没有被使用」,嘉宾包括 Laude Institute 的 Braden Hancock 与 Marin/Open Athena 的 dlwh。

讨论将围绕几个新基准展开:Terminal-Bench Science、JudgmentBench 与 SlopCodeBench,参与者还有 Steven Dillmann、Russell Yang、GOrlanski、vincentsunnchen 等人。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →