GPT-5.5 也只答对 57%:SPIEval 专测移动助手在散落个人信息里的定位能力

SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information

Junjie Ye, Zhuohui Sheng, Shaofan Liu, Yulun Zhu, Wenjie Fu, Dingwei Zhu, Ming Zhang, Yujiong Shen, Weichao Wang, Xin Zhao, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang, Pluto Zhou

cs.CL, cs.AI

2026-08-11

SPIEval 是评测移动助手 LLM 的基准:250 个任务跨 5 项认知能力(推理、消歧、整合、偏好推断、多意图拆解),散布在 10 个 app 的 4,335 条记录里,靠 21 个工具多轮交互。九个模型里最强的 GPT-5.5 (xhigh) 也只到 57.3%,79% 的失败源于定位错了信息,模型一碰到看似合理的记录就不再继续检索去核实。

这篇在解决什么

把 LLM 当手机助手用,最大的难点之一是利用散落在多个 app 里的个人信息去完成指令。比如「给上周出差的供应商存联系方式」可能要跨短信、笔记、语音信箱拼信息;「给爱人打电话」要先认出是谁、再从通话历史推断对方偏好视频通话。但在此之前,没有专门的基准来测这件事,模型在这方面的能力基本是盲区。SPIEval 就是来填这个空白的。

方法

SPIEval 是人工构建的基准,250 个任务均匀覆盖五项认知能力:

任务跑在 10 个模拟 app(住宿、闹钟、通讯录、会议、笔记、日程、短信、交易、出行、语音信箱)上,每个 app 平均 8.1 个字段、区分必填和选填,所以一条记录往往只填了一部分,完整信息要跨 app 拼。一共 4,335 条记录。模型有 21 个工具:11 个检索工具(每个 app 一个加一个全局的,支持子串、正则、模糊匹配,字段定向和分页)和 10 个执行工具。打分不用 LLM-as-judge,而是把模型最终的执行工具调用和人工标注的金标准逐参数比对,完全正确的才算对,人工构造保证 100% 可达。每任务最多 50 轮,每设置跑三次。

结果

九个模型从 GPT-5.5 (xhigh) 57.3% 到 Kimi K2.6 (none) 16.4%:

模型推理档总准确率
GPT-5.5xhigh57.3%
Gemini 3.1 Prohigh53.1%
Claude Opus 4.8max52.3%
DeepSeek-V4-Promax46.5%
Kimi K2.6none16.4%

三项「找已有信息」的能力(推理、消歧、整合)平均约 46%,而偏好推断和多意图拆解只有约一半,因为后两者要推断没写出来的东西。提高推理档平均涨 13.8 分,但模型间差距很大:GPT-5.5 涨 28.8 分,GLM-5.2 只涨 6.0 分。

最关键的发现是定位是主瓶颈。把检索过程整个去掉(相关记录直接放进 system prompt),平均准确率从 35.5% 跳到 66.8%;而把分页改成一次返回全部匹配,只从 35.5% 微涨到 36.0%。说明模型卡在「怎么写出能命中目标记录的查询」上。失败里 79% 是参数值错了(选了看似合理但错误的记录),只有 6% 是漏了必填参数。模型并非在难任务上放弃,只是一碰到看似合理的记录就停手,不再多检索去核实。对全部 126,279 次检索调用的分析显示,98.5% 是最朴素的子串查询,正则和模糊匹配加起来不到 2%,只有 9.5% 限定到具体字段。

为什么重要

这篇把「移动助手利用散落个人信息」这个此前没被专门测的能力,变成了一个可复现、可参数级核验的基准,并用结果指出了一个具体且可修的短板:模型不缺推理,缺的是定位,它们倾向于在第一个看似合理的记录上就拍板,而不是继续检索确认。这对做手机助手、agent 检索增强的团队是明确的信号:与其继续堆推理,不如让模型学会判断「证据够不够」、学会用工具提供的字段定向和模糊匹配,以及在拿不准时多查一轮。

局限与存疑

基准是六位 NLP 研究者花三个月纯人工构建的,规模定在 250 个任务,覆盖广但量级有限,泛化到真实用户手机数据流的程度没验证。数据全是虚构的,不对应任何真人,也因此可能少了真实数据里的噪声和长尾。任务有 50 轮交互上限,反映手机助手的延迟约束,但可能截断了某些需要更多轮的策略。五项能力的任务数虽各 50,但执行操作分布不均(整合和多意图拆解的操作更多)。打分是参数精确匹配,对「同样合理但非金标准」的答案判错,不过作者标注了 7.0% 的参数允许多个合法值来缓解。

术语

原文与代码

相关论文

全部论文解读