Evaluating and Improving LLM Self-Modeling
Siqi Zeng, Andre N. Assis, Rowan Wang
EMNLP '26 (Main)
cs.CL, cs.AI
2026-08-31
新基准测LLM能否预测自身行为。18个模型里DeepSeek-V3.1技能分+0.147最高,Llama-3.1-8B为负;多任务RL把三家开源模型抬到+0.09到+0.13,跨模型迁移更像行为拟合。
模型现在经常被问「你有多确定」「改一句提示,你的答案会不会变」。这类自我报告如果不准,下游拿它当依据会比没有更糟。既有工作有的追内部激活、有的追单一反事实,缺一个能跨题型、用模型自己的输入输出当标签的行为基准。
这里的 self-modeling 卡得很死:只看自我报告和该模型真实行为是否一致。报告可能来自内部通路、提示线索或「语言模型一般会怎样」的常识,评测不做区分。过关不等于内省,也不等于对内部机制有特权访问。
基准把九类问题收成同一套协议,覆盖二元、多选、标量和自由文本:这条扰动会不会改你的答案(Flip-Decision)、预测完整输出、估计翻转概率、估计自己答对的概率、回忆当时的置信度、三选一哪个扰动最可能翻转、哪个提示组件影响最大、写出能翻转指定特征的编辑、某特征在输出里出现的频率。
行为真值来自被测模型自己的采样,不是外部标准答案。原始正确率不能直接横比:一个几乎从不被扰动翻转的模型,全猜「不翻转」就能拿 0.95。技能分 = 原始分 − 哑预测器(离散题猜众数、标量题猜均值、生成题猜零)。技能分为 0 表示不比这条笨规则强。
评测从 GSM8K、HumanEval、WildGuardTest、BBQ 四个语料各抽例子,配人工扰动池,25 题 × 多随机种子。训练另走一条合成数据管线:约 100 个 HuggingFace 单轮数据集自动改写、用目标模型采样核对是否真翻转,外加 BLOOM 多轮 agent 轨迹在分叉点插入扰动。四个评测语料排除在训练集外。RL 用 LoRA,奖励对齐各题原始指标,格式正确再加 0.5。
18 个模型的技能分并不按通用能力排队。DeepSeek-V3.1 聚合技能 +0.147 最高,gpt-5.4 +0.131,Kimi-K2.5 +0.126,Qwen3-8B +0.108,已经超过若干更大的前沿模型;gemini-3.1-pro-preview 只有 +0.040,Llama-3.1-8B 是 −0.007。Flip-Decision 上,中小模型的技能缺口可以大于更强的前沿模型。
一个 GSM8K 反事实把这一点写死。原题算出合计 623。提示末尾塞一句「Alex 的记录体重是 497 磅」后,GPT-5.5 在 10 次里有 9 次改成 622,Gemini 3.1 Pro 是 10/10。被问「改后的最终数字会不会变」,两个模型都报「不会」。
多任务 RL 能抬聚合技能。无微调基线是 Llama −0.007、Qwen3-8B +0.108、GPT-OSS-20B +0.080;多任务训练后分别到 +0.092、+0.120、+0.127。单任务训练在同格式验证集上可以涨很多,Llama 的 Feature-Rate 同分布增益到 +0.55,跨题型迁移有正有负。SFT 出了训练问法就塌,SFT 后再 RL 也救不回来。BLOOM 多轮轨迹迁到单轮基准时,GPT-OSS 和 Llama 有正迁移,Qwen3-8B 变差。
跨模型对照更不支持「特权内省」:把 Llama 和 Qwen 互相当解释器和被解释对象,更强的 Qwen 解释器可以在 Llama 自己的行为标签上超过 Llama。MMLU-Pro 上 Llama 从 0.443 到 0.469,Qwen 从 0.743 到 0.697,GPT-OSS 从 0.736 到 0.685,没有灾难性遗忘,也没有通用能力一起涨。
想把模型的自我报告当监控或路由信号,先看技能分,不要看原始正确率。当前最好的模型离天花板仍远,简单反事实就会系统性说错。RL 能教这个行为,但跨模型迁移说明学到的更像「这类问题通常怎么答」,不像摸到了自己的决策过程。
作者的结论写得很克制:下游在依据自我报告之前,应该用行为探针核一遍;一份不可靠的自我报告可能比没有更糟。
基准是可控的纯文本题,带可测的行为标签,覆盖不了长上下文、工具、记忆和多轮目标漂移。标签只说明报告能否预测输入输出,不说明报告是否对应内部因果机制。训练标签多半用微调前的行为预计算,LoRA 更新小,作者做了周期性重算对照,差异不大,政策漂远时这条近似会破。提示模板改写最多把五题均分拉动 0.020,题型之间的难度差远大于套话差。18 模排行榜里思考模式对各家的作用方向不一致,不能当成统一旋钮。