SpecJudge v0.2.0:强制大模型提供真实引用,修复 8B 模型评估全崩
jokiruiz · reddit · 2026-08-06
开源 CLI 工具 SpecJudge 发布 v0.2.0 版本,该工具旨在根据项目规格推荐性价比最高的 AI 模型。新版本的核心改进是强制要求评估器(LLM)为其打分提供真实存在的文本引用,防止模型用流畅的文本掩盖错误的评分。
开发者在构建回归测试时发现了一个严重 Bug:8B 参数的本地模型在所有测试项目中全军覆没。原因是 Ollama 的 format: json 并不能保证输出完全符合预期的 JSON 结构,模型经常在需要引用 ID 的地方填入 [true]。通过改用严格的 JSON Schema,成功率从 0/9 跃升至 9/9。此外,新版本还固定了采样参数以确保评估结果可复现。
「编程与Agent」频道最新
- 用 Claude 辅助 Three.js 程序化生成朝鲜王朝建筑 — nptacek · 2026-08-06
- Cloudflare OS架构解析:用“欺骗”Agent来确保执行安全 — jedisct1 · 2026-08-06
- DeepSeek API 被曝内置联网搜索:无需第三方接口即可调用 — max_paperclips · 2026-08-06
- 硬核提示词干预:让 Claude 跳出代码死循环 — teortaxesTex · 2026-08-06
- 用 Claude 修复 WebGL2 代码:AI 自查自纠 bug 实录 — teortaxesTex · 2026-08-06
- x402 支付端点生态报告:半数节点不可达 — SashSail · 2026-08-06