通用榜单失效后,开发者如何针对自己的提示词做模型横评
CptMarvelIsDead · reddit · 2026-09-07
Reddit 用户发帖求助:新模型每周都在发,通用 benchmark 对具体业务场景基本没用,想测自己确切提示词在不同模型上的表现,判断新 API 是否值那个价钱、小尺寸本地模型是否够用。目前只能肉眼对比输出,非常痛苦。
帖子抛出三个具体问题:一是主观输出如何定义「好答案」的评分标准;二是用 LLM 当裁判时如何避免它偏爱自己写作风格;三是最省事的多模型并测工具——能否一条提示同时打给云端 API 和本地模型,并排对比。评论区方向可参考社区沉淀的 LLM-as-a-judge 与 promptfoo 类评测工具。
所属事件:新模型扎堆发布致通用榜单失效,开发者求助自测方法(2 条相关)→
「编程与Agent」频道最新
- 「low-code 过时了,现在流行 woah code」:AI 圈新梗刷屏 — jxnlco · 2026-09-07
- 开发者实测 Astra:代码如混淆 JS,但对话体验能忍 — Aryvyo · 2026-09-07
- Agent 时代的 LLM 网关风险:钥匙、烧钱循环与隔离方案 — Technical_Map_2105 · 2026-09-07
- 零 Blender 基础实测:一句话让 Codex 还原游戏 Demo — FuSheng_0306 · 2026-09-07
- LLM 复活经典 Put-That-There:语音加手势在 XR 里免手放窗口 — twi_mar · 2026-09-07
- 18 岁开发者用 MCP 接通 Blender 与 Godot,半天生成末世游戏场景 — majidmanzarpour · 2026-09-07