Snorkel 前沿数据峰会日程曝光:Chollet 领衔,十余个新 Agent 基准集中亮相
StanfordAILab · x · 2026-10-06
Snorkel AI 主办的 Frontier Data Summit(10 月 8 日,旧金山,邀请制)公开议程,集中展示一批将塑造前沿的新 benchmark 与研究,演讲者包括 ARC Prize 的 François Chollet、UC Berkeley 的 Dawn Song、Stanford STAIR Lab 的 Sanmi Koyejo 等。
首批公开的基准与研究方向包括:
- STELLA-Bench、JudgmentBench、ORCA-Bench、HumanOversight Bench 等评测项目
- AgentAbstain、CollusionBench、HalluWorld:聚焦 agent 弃权、共谋与幻觉场景
- Terminal-Bench-Science(Stanford 博士生主导)、AgentLE(UC Berkeley 团队)
- Train-to-Test (T²) Scaling Laws:训练到测试的 scaling 规律研究
三大议题主线:真实工具环境中的 agent 评测、长时程自主行动的度量、多产物复杂输出的可验证评分。Terminal Bench 与 Harbor 共创者 Alex Shaw 也将出席。 post 由 Stanford AI Lab 研究者转发,本人将参会并讨论 coding agent 数据、人类监督与 AI evals。
「研究」频道最新
- 用户模型评测为何难做:斯坦福研究者转向多用户图灵测试 — alexisjross · 2026-10-06
- 神经网络嵌入全部字体,Google Fonts 语料竟排出花朵结构 — Chroma-Crash · 2026-10-06
- Crawler Zoo 推出免费本地模型 agent 对战竞技场 — Time_Instruction_955 · 2026-10-06
- 8K 上下文小模型靠自我调用工具追平 GPT-5.4 百万级上下文 — xennygrimmato_ · 2026-10-06
- 研究者警告:User Sim Index 评测可被轻松刷到 95% — ericzelikman · 2026-10-06
- 用OpenAI Dots智能体集群免费打破47年数学纪录 — jaxchang · 2026-10-06