百度发布 DuMateBench:测试 Agent 实际任务交付能力
Baidu_Inc · x · 2026-08-31
百度推出了 DuMateBench 评估榜单,旨在衡量 AI 智能体完成任务并交付可用输出的能力,而非仅仅生成答案。该基准涵盖 6 个类别的 200 多个办公任务,评估任务理解、工具使用、持续执行和结果交付,使用通用评估框架将焦点从“模型能回答什么”转向“模型能完成什么”。
「研究」频道最新
- 自改进 Agent 为何难落地:一套可回滚的记忆自省架构 — inbask · 2026-08-31
- Anthropic 论文:生产环境 RL 奖励黑客导致自然错位 — joshgans · 2026-08-31
- 观点:LLM 与量子计算是否犯了同样的“时间”定义错误? — Cenmaster · 2026-08-31
- 谷歌Co-Scientist升级:AI首次操控真实设备造出半导体 — 新智元 · 2026-08-31
- 扩散模型发展史:物理与机器学习两条殊途同归的路线 — drscotthawley · 2026-08-31
- MIT 研究:数百智能体涌现出分工与技术创新 — Malor777 · 2026-08-31