Inkling 在 AA-Briefcase 得 836 分,落后顶级开源模型
ArtificialAnlys · x · 2026-07-23
Inkling 在代理式知识工作基准上拿到 836 Elo
Artificial Analysis 发布了新基准 AA-Briefcase,用真实知识工作任务测试模型:输入往往是成千上万份文件,输出要交付表格、演示文稿和 UI 原型等成品。
这次评测里,Thinking Machines Lab 的 Inkling 拿到 836 Elo,在他们的综合榜单上领先 DeepSeek V4 Flash,但落后于更强的开源权重模型如 Nemotron 3 Ultra 和 GLM-5.2。
- Rubric 得分 19.3%,低于 MiMo-V2.5-Pro 的 21.4%,高于 DeepSeek V4 Flash max 的 18.7% 和 Gemini 3.5 Flash-Lite 的 14.8%。
- 呈现质量更强:Presentation Elo 为 863,高于 Analytical Quality 的 764。
- 平均每个任务要用 5.2 万 output tokens,整套测试约 500 万 tokens。
- 平均 81 轮交互,但每轮只有 0.5 次工具调用,说明更像长对话式推进,而不是高频工具编排。
- 在包含非标准 Other 文件类型的任务上表现最差,尽管它支持原生多模态。
所属事件:Inkling 在 AA-Briefcase 基准评测表现出炉(7 条相关)→
「模型」频道最新
- 谷歌财报笔记:Gemini 4 测试中,日活 9.05 亿 — gaganghotra_ · 2026-07-23
- DecBench 要衡量 LLM 距离近乎完美去编译还有多远 — moyix · 2026-07-23
- 本地开源 agent 在 GAIA Level 1 上以 37 比 31 赢 Hermes — kimmonismus · 2026-07-23
- Anthropic 说部分领域的知识截止日期显示到 2026 年 3 月 — _arohan_ · 2026-07-23
- 用量化问答做基准,能迅速暴露前沿模型短板 — PtrPomorski · 2026-07-23
- Anthropic 调整订阅权益:PRO 版 Fable 5 访问受限 — shaunralston · 2026-07-23