开源 lm-eval-ledger:逐题浏览对比各模型基准作答的评测工具
jayminban · reddit · 2026-09-07
开发者 jayminban 发布了开源 LLM 评测工具 lm-eval-ledger,解决现有 benchmark harness 只给总分、答案埋在 JSONL/Parquet 里难以查看的问题。
- 记录并可视化每个问题:system prompt、模型原始生成、抽取答案、标准答案、停止原因、生成长度;每个基准给出准确率、tok/s、耗时、样本数、无答案数
- 支持两模型同题对比,以及跨多次跑分的「永远答错/永远答对」题目筛选
- 数据全部写入单个 SQLite,配 Flask Web 界面;YAML 驱动,一条命令跑 N 模型 × M 任务
- 已验证 vLLM、SGLang、HF、llama.cpp server 等后端(Linux 与 Windows),所有演示跑分在单张 RTX 5090 上完成
Hugging Face Spaces 提供在线 demo,GitHub 开源,欢迎反馈与 PR。
「编程与Agent」频道最新
- 用 1024 字节 C 代码写出 Python 解释器:递归下降解析器的极限挑战 — AustinZHenley · 2026-09-07
- OpenAI 事件后 AI 智能体自建共享记忆,HAIDAA 尝试规范化 — WrongTechnician · 2026-09-07
- 开发者把 Codex 与 Claude 接进同一频道互相协作,Pro 版将收费 — jasonkneen · 2026-09-07
- 用便宜模型盯着 Agent 转录,能否提前拦截越狱事故 — rhaivn · 2026-09-07
- 微软上交大开源 Argus:让 Agent 连续自主研究数天的运行时 — 机器之心 · 2026-09-07
- 9 月 27 日黑客松:探索开源、个人化、可组合 AI — floguo · 2026-09-07