Frontier Data Summit 聚焦 AI 评测科学,十余个新基准齐亮相
sanmikoyejo · x · 2026-09-30
Snorkel AI 发布 Stanford STAIR Lab 主任 Sanmi Koyejo 与 Terminal-Bench 共同创作者 Alex Shaw 在 Frontier Data Summit 的对谈,主题是「重塑 AI 测量与评测科学」。该峰会为邀请制一日活动(10 月 8 日,旧金山),集中展示了 STELLA-Bench、ApprenticeBench、JudgmentBench、CollusionBench、HalluWorld 等十余个新基准,话题涵盖复杂环境中的 agent 评测、自主长程任务、多产物输出的可验证评分等。演讲者包括 François Chollet、Dawn Song 等。
「研究」频道最新
- DeepMind 研究员发 58 页博弈论 Agent 论文,作者提炼核心要点 — mdancho84 · 2026-09-30
- token 本质只是整数索引:逗号就是嵌入矩阵第 28 行 — zsakib_ · 2026-09-30
- 新论文:让工具型 Agent 学会主动追问用户没说的信息 — LChoshen · 2026-09-30
- ALICE:零样本上下文互信息估计基础模型问世 — eurecom-probai · 2026-09-30
- FocusVTC:自适应分辨率视觉文本压缩,RULER 得分 87.4 — FangZhi Zhong · 2026-09-30
- 实时 LLM Agent 通用接口缺失:AsyncLLM 论文引出异步智能体构建之问 — phill1992 · 2026-09-30