Papers with Code 新增按模型大小筛选基准功能

NielsRogge · x · 2026-08-24

Papers with Code 更新功能,现在每个基准都允许按模型大小进行筛选,方便对比不同规模模型的表现。以 Terminal Bench 2.1 为例,这是一个针对容器化终端环境中 Agent 评估的基准,修复了 2.0 版本中的 26 个任务bug,调整了资源限制。列表中展示了包括 GPT-5.6、Kimi K3、GLM-5.3 等未来模型(模拟数据)的评估条目。

所属事件:Papers with Code 支持按模型尺寸筛选基准排行榜(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →