斯坦福团队呼吁共建科研品味基准测试数据集
StanfordAILab · x · 2026-08-23
Chelsea Finn 指出科学发现的关键在于从何处汲取洞察,目前缺乏评估 LLM 这一能力的数据集。团队正在构建一个公开数据集,以捕捉“值得引用的前人工作”这一未记录的决策层,现呼吁研究社区贡献力量并参与构建。
「研究」频道最新
- Ethan Mollick:基于旧模型的 AI 研究需谨慎 — emollick · 2026-08-24
- EMNLP 录用:构建多图医学推理基准数据集 — yuyinzhou_cs · 2026-08-24
- Agent 架构实践:从正则解析转向编译时语义拦截 — demirtasfurkan_ · 2026-08-24
- 研究揭示:优化 Scaffolding 可让弱模型逼近前沿水平 — rohanpaul_ai · 2026-08-24
- NeurIPS workshop非存档性质对申研影响几何?网友热议 — Wonderful_Entry9371 · 2026-08-24
- Φ-Bench 发布:LLM 能否优化自身基础设施? — 青稞AI · 2026-08-24