VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?
Xiaohongshu Inc
cs.CL, cs.AI
2026-08-11
VibeLifeBench 是个生活领域长程智能体基准:200 个跨十领域、模拟周期数周的任务,跑在 22 个 mock 服务上,世界按自己的时钟推进、约 70% 事件不靠用户触发。七个前沿模型里最强的 Claude Opus 5 平均也只拿 32.5 分(满分 100),没有一个能跨全部领域及格。
现在的智能体基准大多用「短、自包含、静态环境」的请求:给一条明确指令,智能体被动执行一次,世界只在智能体自己动作时才变。日常生活的协助完全是另一回事。一个任务要跑几周而不是几分钟;智能体不被提问的时候世界照常在变;很多约束(护照有效期、预算上限、一封钓鱼邮件)从来不会明说。只会回答眼前请求的智能体在这种任务上必然失败。需要的智能体得主动、得持久:自己决定何时动手、何时追问、何时沉默,自己发现没人通报的变化,把一份计划从第一天连贯撑到最后一天。VibeLifeBench 就是来量这个的。
基准由 200 个任务组成,均匀分布在十个日常生活领域(旅行、理财、诉讼、装修、职业、健身、备考、租房、购物、团建),每个领域 20 个。每个任务是一条编排好的多周时间线,跑在一个由 22 个 mock 服务(银行、信用卡、券商、机票酒店火车租车预订、地图、邮件、日历、笔记、通知中心等)组成的模拟世界里。
关键的几点设计:
每任务跑三次,报 avg@3、max@3、min@3 和任务内标准差。
七个前沿模型(Claude Opus 5、GPT-5.5、Gemini 3.5 Flash、Claude Opus 4.8、GLM-5.2、Kimi-K2.6、DeepSeek-V4-Pro)全都很低:
| 模型 | avg@3 | max@3 | min@3 |
| Claude Opus 5 | 32.5 | 41.2 | 23.8 |
| GPT-5.5 | 30.1 | 38.8 | 21.5 |
| Gemini 3.5 Flash | 27.5 | 35.6 | 20.1 |
| DeepSeek-V4-Pro | 21.1 | 24.7 | 17.7 |
七个模型挤在 21 到 33 的窄带里,彼此差距远小于它们和「及格」的差距。更大的更新模型也过不了关。每个模型的 min@3 都不超过 23.8,任务内标准差高达 10.0,即使偶尔蒙对也很难复现。
按能力轴看,主动性和持久性是最弱的两项,没有模型超过 33.6。持久性与记账占全部失败检查的 22.2%,而且每个模型都稳定在 22.0% 到 23.2%:模型不是不写东西,可写出来的很少是打分要求的那种跨阶段、可审计、成形的具体产物。每模型在时间线最后三分之一段的逐阶段通过率比头三分之一低 10 到 15 分,长程一致性随时间衰减。
这篇把三个被现有基准忽视的属性(主动性、活世界适应、长程连贯)放进同一个测量里,并用结果说明:当前模型在专业场景(编码、办公)里很强的工具调用能力,并不会自动迁移到「管几周生活琐事」上。花更多 token 不等于拿更高分(Gemini 3.5 Flash 读最多上下文、回合最多却只排中游),决定分数的是状态有没有被持久地、结构化地记下来。对做个人助手、长程 agent 的团队,这套基准和它点名的四个改进方向(持久记账、主动重新感知世界、安全硬约束、抑制时间衰减)是直接的路线图。
打分是确定性的、只看可观测痕迹,这点比 LLM-as-judge 可靠。但能力轴是靠对检查名做关键词匹配归类的,是「指示性」而非精确,还有 41.8% 的失败落在命名类别之外。22 个服务是 mock,不是真实集成,覆盖的是机制而非真实 API 的长尾麻烦。任务的隐含约束和时间线是人手编排的,虽然做了交叉验证,但 200 个任务的规模有限,泛化到真实用户生活流的程度没有验证。七个模型都用同一套原生工具调用支架、各自最强推理档,支架调优的空间被有意排除,所以分数反映的是模型本身而非最佳工程。