通用榜单失效后,开发者如何针对自己的提示词做模型横评

CptMarvelIsDead · reddit · 2026-09-07

Reddit 用户发帖求助:新模型每周都在发,通用 benchmark 对具体业务场景基本没用,想测自己确切提示词在不同模型上的表现,判断新 API 是否值那个价钱、小尺寸本地模型是否够用。目前只能肉眼对比输出,非常痛苦。

帖子抛出三个具体问题:一是主观输出如何定义「好答案」的评分标准;二是用 LLM 当裁判时如何避免它偏爱自己写作风格;三是最省事的多模型并测工具——能否一条提示同时打给云端 API 和本地模型,并排对比。评论区方向可参考社区沉淀的 LLM-as-a-judge 与 promptfoo 类评测工具。

所属事件:新模型扎堆发布致通用榜单失效,开发者求助自测方法(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →