SpecJudge v0.2.0:强制大模型提供真实引用,修复 8B 模型评估全崩

jokiruiz · reddit · 2026-08-06

开源 CLI 工具 SpecJudge 发布 v0.2.0 版本,该工具旨在根据项目规格推荐性价比最高的 AI 模型。新版本的核心改进是强制要求评估器(LLM)为其打分提供真实存在的文本引用,防止模型用流畅的文本掩盖错误的评分。

开发者在构建回归测试时发现了一个严重 Bug:8B 参数的本地模型在所有测试项目中全军覆没。原因是 Ollama 的 format: json 并不能保证输出完全符合预期的 JSON 结构,模型经常在需要引用 ID 的地方填入 [true]。通过改用严格的 JSON Schema,成功率从 0/9 跃升至 9/9。此外,新版本还固定了采样参数以确保评估结果可复现。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →