EgoTools 基准:AI 仍难理解人类为何选工具,8B 微调反超开源
liuziwei7 · x · 2026-10-06
NTU S-Lab 与 Ropedia 发布 EgoTools 基准,考察 AI 对第一人称视频中工具使用意图的理解——不是认出工具,而是理解人为什么选这个工具、如何用它完成任务。
- 数据规模:100 小时第一人称视频、1,000 道诊断题,附带 8B 参考模型。
- 用相同 backbone 微调后成绩从 50.0 提升到 60.9,反超所有开源模型。
- 但空间推理能力反而退化 11 分,暴露能力此消彼长的问题。
- 人类专家仍有 83.2 分,与最佳模型差距明显。
「研究」频道最新
- 4478人参赛120国,BioHub细胞追踪Kaggle挑战赛收官 — WalterReade · 2026-10-06
- 网传超导突破被纠正:实为模拟中的低温半导体,非颠覆性成果 — altryne · 2026-10-06
- Anthropic x Adaptyv 蛋白质设计竞赛第二关:设计 TNF-α pH 响应结合剂 — CatAstro_Piyush · 2026-10-06
- 用 signature 回归做经济数据 nowcasting,新方法论文发布新版 — lihua_lei_stat · 2026-10-06
- 谷歌 Cogentic 多智能体系统在 5 个公开数学问题上取得新成果 — Dr_Singularity · 2026-10-06
- 学者提议:审稿人可凭 Pangram 检测拒审 AI 生成投稿 — PeterHndrsn · 2026-10-06