重读 2022 年 APE 论文:LLM 自动写 prompt 已达人类水平
cephaloform · x · 2026-09-27
作者推荐 pre-chatbot 时代的论文《Large Language Models Are Human-Level Prompt Engineers》(arXiv:2211.01910,2022 年 11 月),称其为自己的灵感来源,类似今天用基础模型搭的合成数据生成工厂。
论文核心(Automatic Prompt Engineer,APE):
- 把指令当作「程序」,让 LLM 提出一批候选指令,再用打分函数搜索优化
- 用另一个 LLM 执行所选指令的 zero-shot 表现来评估指令质量
- 在 24 个 NLP 任务上,自动生成的指令大幅超过此前 LLM 基线,其中 19/24 个任务达到或超过人类标注者手写的指令
- APE 生成的 prompt 还可用于提升模型 truthful/informative 表现,以及加入 in-context learning 提升 few-shot 性能。
「研究」频道最新
- 新采样方法 CNS 给扩散模型注入彩色噪声,显著改善 FID — serrjoa · 2026-09-27
- 学者预测:数月内投稿前不用 AI 验证证明将成「不当行为」 — RexDouglass · 2026-09-27
- JevBench 评测者:多数模型输在设置与校准等低级失误 — airesearch12 · 2026-09-27
- 「数学实际上已死」:新文呼应 Daniel Litt 对 AI 时代数学未来的判断 — burny_tech · 2026-09-27
- ForecastingCo 首篇论文:教 Transformer 处理真实时序数据做预测 — fpedregosa · 2026-09-27
- 研究:预训练 LLM 微调后可做侧信道攻击,12 条迹即破解 AES 密钥 — chaumian · 2026-09-27