Terminal-Bench 首发前凑不齐 10 人,现聚会挤进约 150 人
simonguozirui · x · 2026-09-24
Laude Institute 透露,Terminal-Bench 团队首次发布前曾因觉得凑不齐 10 人讨论而取消任务撰写聚会;如今他们的聚会挤进了约 150 人。活动介绍了 benchmark 与 Harbor 框架现状、Terminal-Bench-Science 的制作过程,以及模型进步后评测如何跟上:持续更新 benchmark、真实世界 eval、长程多智能体挑战。
「研究」频道最新
- 同一提示词 GPT-3.5 全说漏,GPT-4 却 30/30 返回空响应 — rayanpal_ · 2026-09-24
- Amazon 论文:高斯过程智能分配重排预算,RAG 检索质量提升 5.4 nCG@100 — _reachsumit · 2026-09-24
- 论文:LLM 重排被检索召回封顶,实测打不过简单协同过滤基线 — _reachsumit · 2026-09-24
- 超越单一标量:分发式服务接口让多个任务头复用观看时长分布 — _reachsumit · 2026-09-24
- Meta 实测 Muse Realtime Avatar:盲测偏好胜两大商用数字人系统 — AIatMeta · 2026-09-24
- LLM 荐股评分近于抛硬币,开发者用股价当标签重做新闻筛选器 — Fun_Water2230 · 2026-09-24