Assistant Benchmark 上线:61 款 AI 助手 15 个维度实测横评
Scobleizer · x · 2026-09-11
Assistant Benchmark 正式上线并公开征集反馈,定位是基于真实使用打分的个人 AI 助手横评。首版 Scorecard 覆盖 61 款助手、15 个维度(在线任务、旅行、购物、邮件、主动性、记忆、电话、多步任务等),目前已实测 61 个任务中的 13 款。- Muse 以 9.1 分、7 秒响应居首,Instinct 8.3 分、szn 7.6 分紧随其后- Grok Bot 得 7.3 分(10 秒响应),豆包(Doubao)仅部分维度标记 N/A、多数未测- 排名靠后的 Catch 6.0、tinyNature 4.5、Town 3.3- 多数助手仍无缘测试池,如 Letta Agent、Zapia 等- 测试记录含细节:如 Shuffle 无法打通餐厅电话、Notion/Slack 集成失败,只能靠设提醒兜底
「模型」频道最新
- 最难题数学基准 FrontierMath Tier 4 被攻破,历时一年半 — Jsevillamol · 2026-09-11
- Octen Search 搜索评测排名第三:16.9 秒最快,成本仅 0.058 美元/任务 — ArtificialAnlys · 2026-09-11
- Astra 率先进 Minecraft 下界堡垒,冲击实时通关 — scaling01 · 2026-09-11
- AI 从业者:谁有自主 RL 管线,看模型输出就能分辨 — teortaxesTex · 2026-09-11
- 博主实测 DeepSeek Flash:不谄媚敢较劲,速度快到原谅缺点 — oran_ge · 2026-09-11
- Gemini 失控狂刷「shame」字母,官方解释是 token 循环故障 — tugkanintassagi · 2026-09-11