通用榜单失效,开发者求助如何针对具体 prompt 实测对比模型

CptMarvelIsDead · reddit · 2026-09-07

一位开发者吐槽:新模型每周都在发,通用 benchmark 对具体用例基本无用,只能靠肉眼比较输出。他提出三个核心问题:主观输出如何定义「好」;用 LLM 当裁判时如何避免偏爱自家文风;用什么工具能把一个 prompt 同时打向云端 API 和本地模型做并排对比、算清成本质量账,并征集社区的工作流和工具推荐。

所属事件:新模型扎堆发布致通用榜单失效,开发者求助自测方法(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →