提示词修一处悄悄毁另一处:输出预算守恒导致无信号回归

ClickOk5811 · reddit · 2026-09-26

作者描述提示词工程中一个隐蔽陷阱:审查提示词加了「注重安全」后,硬编码凭据漏报解决了,但两周后大 PR 上的风格反馈几乎消失。原因是模型输出有固定预算(在「be concise」约束下愿意说的话总量),加在安全上的权重必然从别处挤占——没有任何报错、diff 或信号提示这种权衡。自然语言提示词不是一组独立规则,而是一段互相挤压的混合文本。作者给出的对策习惯:维护一小组固定的测试输入,每次改动后全部重跑,而不只测触发修复的那个用例。多数提示词回归之所以「隐身上线」,正是因为没人重跑旧用例,大家只检查已知坏掉的。作者在征求他人是否也遇到这种「修一处坏另一处」的回归形态。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →