开源 lm-eval-ledger:逐题浏览对比各模型基准作答的评测工具

jayminban · reddit · 2026-09-07

开发者 jayminban 发布了开源 LLM 评测工具 lm-eval-ledger,解决现有 benchmark harness 只给总分、答案埋在 JSONL/Parquet 里难以查看的问题。

Hugging Face Spaces 提供在线 demo,GitHub 开源,欢迎反馈与 PR。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →