TextReg 治理提示词过拟合,TextGrad 之上最高提升 11.8%
GeorgiaTech · hf · 2026-10-06
佐治亚理工研究指出,迭代式 prompt 优化方法(如 TextGrad)常出现「提示词分布过拟合」:prompt 越改越长、堆满针对特定样本的窄规则,出训练分布后泛化很差。作者将其归因于离散文本空间优化缺乏表征控制,并提出「表征低效」双因子度量(容量成本 + 范围狭窄)来刻画这一失效模式。
TextReg 通过正则化文本梯度实现软惩罚目标,包含三个组件:双证据梯度净化、语义编辑正则化、正则化引导的 prompt 更新。
在多个推理基准上,TextReg 显著提升分布外泛化:相对 TextGrad 最高 +11.8%,相对 REVOLVE 最高 +16.5%。
「研究」频道最新
- Sander Dieleman 长文:连续扩散语言模型为何卷土重来 — LucaAmb · 2026-10-06
- 审计 7 款 LLM 评测工具源码,发现 13 处打分与实际检查不符 — maverick_man1111 · 2026-10-06
- 为修评测而生的 Terminal-Bench Pro:8 领域 400 任务零污染 — thisguyknowsai · 2026-10-06
- ROME 训练管线拆解:500B token CPT 加两阶段 SFT 与 RL — thisguyknowsai · 2026-10-06
- ROME 提出 IPA:按块而非按 token 分配 RL 信用 — thisguyknowsai · 2026-10-06
- ROME 模型先行搭建 ROLL/ROCK/iFlow 全套智能体基础设施 — thisguyknowsai · 2026-10-06