新模型扎堆发布致通用榜单失效,开发者求助自测方法
随着新模型几乎每周发布,开发者发现通用 benchmark 对自己的具体提示词和业务场景基本失效,只能肉眼比较输出。Reddit 上的求助帖引发讨论,焦点包括:主观输出如何定义「好」、用 LLM 当裁判时如何避免偏爱自家模型、以及如何通过针对确切提示词的横评来判断新 API 是否值得付费、小尺寸模型是否够用等实际问题。
2026-09-07 ~ 2026-09-07 · 2 条相关
- 通用榜单失效后,开发者如何针对自己的提示词做模型横评 — CptMarvelIsDead · 2026-09-07
- 通用榜单失效,开发者求助如何针对具体 prompt 实测对比模型 — CptMarvelIsDead · 2026-09-07