Inkling 在 AA-Briefcase 得 836 分,落后顶级开源模型
ArtificialAnlys · x · 2026-07-23
Inkling 在代理式知识工作基准上拿到 836 Elo
Artificial Analysis 发布了新基准 AA-Briefcase,用真实知识工作任务测试模型:输入往往是成千上万份文件,输出要交付表格、演示文稿和 UI 原型等成品。
这次评测里,Thinking Machines Lab 的 Inkling 拿到 836 Elo,在他们的综合榜单上领先 DeepSeek V4 Flash,但落后于更强的开源权重模型如 Nemotron 3 Ultra 和 GLM-5.2。
- Rubric 得分 19.3%,低于 MiMo-V2.5-Pro 的 21.4%,高于 DeepSeek V4 Flash max 的 18.7% 和 Gemini 3.5 Flash-Lite 的 14.8%。
- 呈现质量更强:Presentation Elo 为 863,高于 Analytical Quality 的 764。
- 平均每个任务要用 5.2 万 output tokens,整套测试约 500 万 tokens。
- 平均 81 轮交互,但每轮只有 0.5 次工具调用,说明更像长对话式推进,而不是高频工具编排。
- 在包含非标准 Other 文件类型的任务上表现最差,尽管它支持原生多模态。
所属事件:Inkling 参与 AA-Briefcase 评测,呈现能力优于分析(7 条相关)→
「模型」频道最新
- BullshitBench 榜单更新:GPT-6-Astra 领先历代 OpenAI 模型仍未及 Anthropic — scaling01 · 2026-09-11
- Agent Astra 在 GauntletBench 得 83%,成首个超人类基线的电脑操作 Agent — ducha_aiki · 2026-09-11
- Kimi K2.8 Preview 上线:性能接近 K3、1M 上下文全档开放 — teortaxesTex · 2026-09-11
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用户呼声下 DeepSeek V4 Pro API 宣布继续服务,计费不变 — teortaxesTex · 2026-09-11
- 第三方实测:DeepSeek V4.1 Flash 达 GPT-6 Astra 98% 分,成本仅 1.4% — ayushtweetshere · 2026-09-11