一个设计团队做了个评测,阻止 AI 文案靠感觉上线
Fit_Average8352 · reddit · 2026-07-28
作者从设计转到工程后,最受不了的一点是:AI 生成的界面文案经常靠感觉放行——有人读一眼说“看起来没问题”,然后就上线了。于是他做了一个小型 eval 评分器,想把这种“看着行”变成可度量的标准。
这套评估会检查多个维度:是否用了团队既定术语而不是自己乱造同义词、阅读难度是否在范围内、在少量标注样本上是否符合品牌语气、是否出现了他们明令禁止的“不是 X,而是 Y”式句式。每个维度都会打分,低于阈值就交给人工复核,而不是自动通过。
作者也承认这不是魔法:语气本来就很模糊,而且标注集很小,所以它只能抓明显问题,细微之处还是得靠人。但它确实把“看着行”变成了一个能指出依据的流程,并且阻止了同样的文案问题反复上线。
「编程与Agent」频道最新
- 12 个真实多应用智能体任务中,Fable 5 与 Kimi K3 同为 7/12 — Nearby_Pair_6483 · 2026-07-28
- 用户称本周要把 Codex 用到所有事情里,界面已显示周度额度 — rudrank · 2026-07-28
- 别被平均对话轮次误导:客服与编程 Agent 需要不同架构 — hugobowne · 2026-07-28
- 有人在 Claude Code 的 ultra mode 里测试 Qwen 3.8 Max — jasonkneen · 2026-07-28
- 有人想要能说能听还会调度 agent 的本地 ChatGPT Live — anonthatisopen · 2026-07-28
- EviBack 用教师回退训练 agentic RAG 的零奖励轨迹 — _reachsumit · 2026-07-28