SPIEval:评估大模型作为移动助手处理分散个人信息的能力
Junjie Ye · hf · 2026-08-12
SPIEval 专门针对移动助手场景下的大语言模型进行了基准测试,重点关注它们处理分散个人数据的能力。评估结果揭示了当前模型在信息检索和验证环节存在显著缺陷。
「应用」频道最新
- 实测ASD-STE100提示词:有效去除技术文档废话 — DanielLockyer · 2026-08-12
- 绕过 Claude 隐形水印:开发者推出免费改写破解工具 — MatthewChang · 2026-08-12
- ChatGPT、Gemini 与 Claude 定时任务功能实测对比 — EverydayAI_ · 2026-08-12
- Supermemory企业版降至100美元,支持千人员工集成 — julianweisser · 2026-08-12
- Bloome 主打多 Agent 协同办公,支持 Claude Code 与 Codex — vista8 · 2026-08-12
- 实测 xAI Grok bot:三个Agent烧掉一周32%额度,暂无必要安装 — vista8 · 2026-08-12