LiveClawBench评估真实助手任务

jiqizhixin · x · 2026-07-12

来自 Samsung、HKUST、CityU 和 PKU 的研究者提出 LiveClawBench,用于评估 AI assistant 在复杂真实任务中的表现。

核心设计

结论

作者认为,这个基准比现有 benchmark 更能测试“现实世界里的复杂 assistant 任务”,尤其是多轮、跨服务、需要保持状态的场景。帖子附了论文、GitHub 和报告链接。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →