开源无依赖 LLM 评测工具:盯回归而非平均分

zahidsaim23 · reddit · 2026-09-07

一位日常做 LLM 评测的作者开源了一个零依赖、仅用 Python 标准库的轻量评测框架(MIT):github.com/zahid23saim/llm-eval-harness。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →