开源两大新基准:测试 AI 在意图展开与计划变更中的表现
AIwithGhotai · x · 2026-08-28
针对需要在动态环境中运行的 Agent,开源了两个新基准:
- VibeSearchBench:测试意图在多轮对话中逐渐展开的场景。
- VibeLifeBench:测试任务中途计划与条件发生变化的场景。
这些基准旨在评估 Agent 在世界状态不稳定情况下的适应能力,而非假设环境保持静止。
「研究」频道最新
- 399 美元开源双足机器人 Microduck,支持 Sim2Real 自定义策略 — CyberRobooo · 2026-08-28
- Sai 代理登顶 OSWorld 2.0,成本仅为竞品 2/3 — TianbaoX · 2026-08-28
- 多样性预训练可减少机器人特定数据需求 — chris_j_paxton · 2026-08-28
- 新基准 PACT:一句施压让模型违规率升 65%,无一适合无人监督 — baseten · 2026-08-28
- 蛋白质语言模型 ESM 之父 Alex Rives 入选 TIME100 AI 榜单 — proteinrosh · 2026-08-28
- 分层字节语言模型新论文:动态多字节预测提速推理 — madeofAjala · 2026-08-28