Papers with Code 支持按参数量筛选榜单,可查 6B 以下模型 SWE-Bench 成绩
NielsRogge · x · 2026-09-09
Hugging Face 工程师 NielsRogge 介绍,Papers with Code 的基准榜单新增按参数规模筛选功能。
亮点示例:SWE-Bench Verified 上可单独查看参数量 ≤6B 的模型/智能体成绩,方便追踪小型模型在真实软件工程任务上的 SOTA 进展。SWE-Bench Verified 是从 SWE-bench 测试集人工校验出的 500 道真实软件问题子集,榜单同时收录了 Claude、DeepSeek、Gemini、Kimi、MiniMax 等众多模型与 agent 相关论文的评测结果。
「编程与Agent」频道最新
- 论文揭示 Agent 记忆更新后计划仍是旧的,PLANFENCE 拦下全部失效动作 — rohanpaul_ai · 2026-09-09
- 开源 VoiceStudio 复刻 ElevenLabs 全家桶:646 种语言全本地运行 — thisguyknowsai · 2026-09-09
- 用户 /review subagent 消失,Teknium 回应:更新后即可恢复 — Teknium · 2026-09-09
- 分层摘要压到 8k 上下文,Qwen 长对话 120 条后仍崩溃 — Zeeplankton · 2026-09-09
- IndeHub 第16期线下活动:用 AI Agent 完成从建应用到上架变现全流程 — rudrank · 2026-09-09
- 用户痛点:AI 助手之间缺互通层,集成越多锁定越深 — mobileraj · 2026-09-09