LLM 评测研究显示,提示词微调就能翻转排行榜
jindong_wang92 · x · 2026-08-04
这位研究者回顾了 LLM 评测路线:关键是让评测系统跟上模型迭代
作者分享了自己过去几年在 LLM evaluation 上的研究脉络,核心问题是:如何构建一种评测系统,能像模型一样快速演化。
主要发现
- 提示词敏感性真实存在:很小的 prompt 变化就可能改变结果。
- 基准排名并不稳定:轻微扰动就能导致榜单翻转。
- 因此,鲁棒性 被推进成 LLM 评测中的核心维度之一,PromptBench 就是这一方向的重要工作。
影响与后续演化
- PromptBench 不只是一个单独基准,而是把“鲁棒性评测”变成了更重要的研究议题。
- 后续的 DyVal 也从一个 benchmark 进一步演化成更广泛的研究范式:
- 从理论与方法出发,发展到 DyVal 1、DyVal 2;
- 进入产业协作阶段,包括与 Azure 团队共同开发,以及被 Phi 团队测试;
- 还带动了社区跟进,覆盖网络分析、智能体、推理、归纳、任务与多模态等方向。
配图还提到,这项工作背后有 MSRA 实习生、MS FTE、外部合作研究者参与,并获得 MSRA 内部资金及来自 Amazon、Google、NVIDIA 等的教职资助。
「公司和人」频道最新
- Sakana AI 加入日本 AI 机器人协会,推进世界模型与物理 AI — SakanaAILabs · 2026-08-04
- Paul Graham 称 Greptile 营收下滑已几乎消失 — ycombinator · 2026-08-04
- Exa 称网页索引已达 800 亿页面,2027 年冲击 Google 规模 — garrytan · 2026-08-04
- 机器人 OEM 称可在 30 天内完成排障改板并交付 — MatthewChang · 2026-08-04
- 云厂商与 AI 供应商正在制造昂贵的锁定风险 — DavidLinthicum · 2026-08-04
- SK 海力士将在印第安纳州动工 38.7 亿美元 HBM 封装厂 — rwang07 · 2026-08-04