Papers with Code 新增按模型大小筛选基准功能
NielsRogge · x · 2026-08-24
Papers with Code 更新功能,现在每个基准都允许按模型大小进行筛选,方便对比不同规模模型的表现。以 Terminal Bench 2.1 为例,这是一个针对容器化终端环境中 Agent 评估的基准,修复了 2.0 版本中的 26 个任务bug,调整了资源限制。列表中展示了包括 GPT-5.6、Kimi K3、GLM-5.3 等未来模型(模拟数据)的评估条目。
所属事件:Papers with Code 支持按模型尺寸筛选基准排行榜(2 条相关)→
「编程与Agent」频道最新
- 企业 Agent 需架构约束,非仅数据质量 — jonerp · 2026-08-24
- 谷歌发布 Developer Knowledge MCP,集成 19 套文档 — rseroter · 2026-08-24
- 用 Cloudflare Workers 写了个 Agent 专治网页设计垃圾 — craigsdennis · 2026-08-24
- Obsidian 插件 Smart Chat:AI 对话链接与状态直接存进笔记 — AINewsletter · 2026-08-24
- 用 AI 写代码虽快,但理解项目历史却成了新负担 — Warm-Reaction-456 · 2026-08-24
- 给每个 Agent 分配真实邮箱后,我们踩了这些坑 — saltexx · 2026-08-24