通用榜单失效,开发者求助如何针对具体 prompt 实测对比模型
CptMarvelIsDead · reddit · 2026-09-07
一位开发者吐槽:新模型每周都在发,通用 benchmark 对具体用例基本无用,只能靠肉眼比较输出。他提出三个核心问题:主观输出如何定义「好」;用 LLM 当裁判时如何避免偏爱自家文风;用什么工具能把一个 prompt 同时打向云端 API 和本地模型做并排对比、算清成本质量账,并征集社区的工作流和工具推荐。
所属事件:新模型扎堆发布致通用榜单失效,开发者求助自测方法(2 条相关)→
「编程与Agent」频道最新
- 开发者吐槽 AI 生成 UI 一团糟,计划重构换 BaseUI 立规矩 — tomjohndesign · 2026-09-07
- 「low-code 过时了,现在流行 woah code」:AI 圈新梗刷屏 — jxnlco · 2026-09-07
- 开发者实测 Astra:代码如混淆 JS,但对话体验能忍 — Aryvyo · 2026-09-07
- Agent 时代的 LLM 网关风险:钥匙、烧钱循环与隔离方案 — Technical_Map_2105 · 2026-09-07
- 零 Blender 基础实测:一句话让 Codex 还原游戏 Demo — FuSheng_0306 · 2026-09-07
- LLM 复活经典 Put-That-There:语音加手势在 XR 里免手放窗口 — twi_mar · 2026-09-07