14 个用例复现完整榜单:Terminal Bench Mini 加速本地模型评测
asankhs · reddit · 2026-09-22
Reddit 用户 asankhs 发布了 Terminal Bench Mini,一个仅含 14 个实例的 terminal-bench 子集,参考 deepswe-mini 的思路构建。它能在本地 LLM 上以远快于完整 agentic 评测的速度运行,同时生成与 terminal-bench 完整排行榜高度一致的代表性排名,解决本地模型跑标准 agent 评测太慢的痛点。数据集已在 Hugging Face 上开源(LocalLLaMA/terminal-bench-mini)。
「研究」频道最新
- 研究者提议:用 RL 教 AI 学会在恰当时机放弃 — sqcai · 2026-09-22
- Dinur 凭 2006 年 PCP 定理新证摘得哥德尔奖,两节课即可讲完 — willcb · 2026-09-22
- Nature 发表 Delphy:近实时贝叶斯系统发育学追踪疫情爆发 — burny_tech · 2026-09-22
- Google 杰出科学家 Milanfar 将在 UCSB 讲 AI 计算成像未来 — docmilanfar · 2026-09-22
- FLA 库 KDA fast path 被曝前缀输出泄漏未来门控,下版修复 — YouJiacheng · 2026-09-22
- Halvar Flake 演讲:计算机科学正从精确学科变成概率学科 — soumitrashukla9 · 2026-09-22