DeepSWE-mini:16 实例子集可复现完整排行榜排名
asankhs · reddit · 2026-09-18
作者发布新数据集 DeepSWE-mini(Hugging Face: LocalLLaMA/deepswe-mini),是 DeepSWE 编码基准(deepswe.datacurve.ai)的 16 实例子集。通过分析完整基准选出的子集能忠实复现各模型的相对排名(非绝对分数),可用于在本地快速基准测试新模型,大幅省去完整基准漫长的运行时间。
所属事件:DeepSWE-mini 发布:16 例即可复现完整排行榜(2 条相关)→
「研究」频道最新
- Zoom 实证研究:上下文管理省成本,规划对强模型只是省钱手段 — ZoomCommunications · 2026-09-18
- VA-Bench 实测:最强模型具身操作任务成功率仅 53.9% — dalian-university-of-technology · 2026-09-18
- NVIDIA SoL-Pi:auto-research 循环让编码 agent 省一半 token — nvidia · 2026-09-18
- RiskChainBench:还原混淆消息到网页取证,十模型最高仅 62.8% — ZhuoXin Liu · 2026-09-18
- Vision-RL2:区域级强化学习让 MLLM 用 1/4 视觉 token 超越满分辨率 — Yuheng Shi · 2026-09-18
- 「The Pile 含 8% 基督教内容」论文遭打脸:关键词法误计长篇书籍 — cis_female · 2026-09-18