Inkling 在 AA-Briefcase 基准评测表现出炉

Artificial Analysis 公布了 Inkling 在全新代理式知识工作基准 AA-Briefcase 上的详细评测数据。该基准主要通过处理海量文件并交付表格或演示文稿等真实任务来测试模型能力。整体来看,Inkling 获得 836 Elo,落后于顶级开源模型,其 rubric 得分为 19.3%,处于 MiMo-V2.5-Pro(21.4%)与 DeepSeek V4 Flash max(18.7%)之间。

细项表现与短板

Inkling 在能力分布上呈现出明显的偏科:其呈现能力 Elo 为 863,明显高于分析质量 Elo 的 764,说明它更擅长把最终答案做得好看、易于交付,但在分析结构和推理深度上相对较弱。此外,尽管 Inkling 宣称具备原生多模态支持,但它在处理非标准的“Other”文件类型(即不属于 Excel、PowerPoint、PDF、Word 的材料)时失分最为严重,成为最弱项。

任务执行与资源消耗

在执行策略与开销方面,Inkling 平均每个任务会进行 81 轮交互(中位数为 49 轮),说明它在部分任务中会走很长的交互链路;然而其平均每轮仅调用 0.5 次工具,处于较低水平。资源消耗上,该模型平均每任务耗用约 5.2 万 output tokens,跑完整套基准大约需要消耗 500 万 tokens。

2026-07-23 ~ 2026-07-23 · 7 条相关