Aging of Prompt Engineering Techniques Across LLM Versions
Anastasiia Rudyk, Julian Oertel, Regina Hebig
cs.SE
2026-08-25
Rostock用218个Python任务、近两万次生成对比三代模型,发现提示工程收益按家族分化:新GPT上Few-Shot边际比上一代低7.4点,Qwen2.5上CCoT相对增益11.5点。
提示配方经常被当成可以跟着模型一起升级的固定资产:Few-Shot、CoT、再叠对比样例,换代时默认「更强的模型只会吃得更好」。Rostock大学这组人要核对的是另一件事:同一套提示工程技术(PET)跨过一代之后,边际收益会不会变薄,甚至变负。
Khojah等人2025年的CodePromptEval已经在函数级代码生成上测过提示组合,那是横截面。新模型发布很快,缺的是版本对版本的对照。如果推理脚手架已经被后训练内化,继续往提示里塞逐步思考,就可能变成噪声。
这是对Khojah et al.的部分复现,不做全因子叠加。数据从CodePromptEval清洗而来:221个Python函数级任务去掉3个Few-Shot格式不合格的,得到218个;又有23个任务至少一次抽不出代码,整组剔除后剩195个进入计分。五个模板各自单跑:
三对模型:GPT-3.5-Turbo与GPT-4o,Qwen2-7B-Instruct与Qwen2.5-7B-Instruct,Mistral-7B-Instruct与Mistral-Large-2407(约123B)。温度0.2、每提示三次,1090条提示共19620次生成,有效评测17550个函数。只报pass@k功能正确性,不再看CrystalBLEU和代码异味。模型选取要求训练截止日期早于CoderEval在2024年2月发布,尽量压数据泄漏。
和Khojah原结果比,同一195题上GPT-4o的pass@1平均低约6.5个百分点,Few-Shot差得最多:43.6%对51.6%。基线排序符合预期。
| 模型 | pass@1 | pass@3 |
| Qwen2 | 35.59% | 36.72% |
| Qwen2.5 | 36.41% | 42.36% |
| Mistral-7B | 36.92% | 40.82% |
| Mistral-Large | 42.36% | 44.00% |
| GPT-3.5-Turbo | 42.87% | 44.00% |
| GPT-4o | 43.38% | 44.51% |
相对Zero-Shot,GPT-3.5上Few-Shot大约+10个百分点、PoT大约-7个百分点;到GPT-4o,Few-Shot只剩约+1到+5,CCoT仍为正(三次运行+6.0/+9.6/+12.4)。Qwen2上Few-Shot和CCoT多为负;Qwen2.5上CCoT转正,且从pass@1到pass@3多出5.95个百分点,是多采样受益最大的模型。Mistral-7B上Few-Shot、CoT、PoT都有增益;到Large,CCoT仍强(三次运行约+8.6到+15.2),CoT和PoT转负。
表VII把「后继模型相对前代,在该PET上的Δ」摊开:Qwen的CCoT +11.5、Few-Shot +7.9;Mistral的CoT -13.8、PoT -12.1,CCoT仍+5.6;GPT的Few-Shot -7.4,CCoT只剩+1.1。GPT-4o从pass@1到pass@3只多1.13个百分点,能解的题第一次就解了。
老化按家族切开,不是按「新模型一律不吃提示」切开。
给代码助手提示库一条可执行的警告:配方不能当不可变资产。换家族或换代,至少重跑Zero-Shot对照。更强的闭源模型上,先试最短提示;7B级Qwen上,Few-Shot和带正负样例的CCoT仍可能换来两位数相对增益。CCoT是这篇里跨家族最稳的正信号,因为它多给了可核对的对错示范,而不只是「请逐步思考」。
这是渐进的实证更新,不是新方法。价值在于把「提示工程会过时」从观感变成按家族可核对的数字。
任务只覆盖Python函数级生成,195题、每提示只采样3次,统计效力有限。Mistral这对不是同尺度迭代:7B对123B,版本效应和参数量缠在一起;7B还强制包了[INST]标记,Large没有,提示格式本身不齐。复现GPT-4o比原论文低6.5个点,评估管道没有完全对齐。只报pass@k,可读性、安全和效率都不在账上。改编PoT已经不是Chen等人原定义,负结果不能直接打回给原始PoT。GPT-3.5到GPT-4o也不是相邻小版本,「内化」叙事对这条线过强。