去掉所有格 have,三家小模型伦理推理涨 19.1 个百分点

Umwelt Engineering: Designing the Cognitive Worlds of Linguistic Agents

Rodney Jehu-Appiah

cs.CL, cs.AI

2026-03-29

4470 次试验里,禁所有格 have 让伦理推理涨 19.1 个百分点、分类涨 6.5;16 个语言约束调试 agent 无人单独超过对照,3 个凑齐覆盖 100%。

这篇在解决什么

Prompt engineering 管「问什么」,context engineering 管「推理时知道什么」。两层都默认语言是透明管道:改内容,不改媒介。

对人还说得通。人可以在空间直觉、情绪、肌肉记忆里想完,再用语言说出来。标准 LLM 没有这层底下的认知,推理就发生在 token 流里。能用的词、能写的句法、能做的概念区分,就是它能进行的认知操作。

Jakob von Uexküll 把生物感官筛出来的那一块世界叫 Umwelt。这篇把这个词接到 agent 设计上,主张在 prompt 和 context 之上再加一层:Umwelt engineering,刻意设计模型用来思考的语言环境。旁证并不稀缺:中英训练模型的因果注意落点不同;纯文本、Markdown、JSON 三种格式能让同一任务上下摆到 40%;合成推理语言 Mentalese 能把 token 压到 4 到 16 倍还保住九成准确率。这篇要直接测更硬的一句:只改推理媒介、题目不动,分数会不会跟着动。

方法

实验 1 测两条禁词。

模型是三家便宜指令模型:Claude Haiku 4.5、GPT-4o-mini、Gemini 2.5 Flash Lite。七类题共 130 道:三段论、因果、类比、分类、认知校准、伦理两难、数学应用题。每题乘三条件、三模型、4 次(1 次温度 0,3 次 0.7)。计划 4680 次,跑完 4470 次,可打分 4344 次。

实验 2 换问题。16 个 agent 各带一种语言约束,温度 0,解 17 道软件调试题、51 条 ground-truth。对照是普通英语调试指令。看并集覆盖,不看单兵是否更高。

结果

No-Have 是更稳的那把刀。

任务对照No-HaveE-Prime
伦理两难76.6%95.6%(+19.1 pp)92.1%(+15.5 pp)
分类93.0%99.6%(+6.5 pp)96.2%(+3.1 pp)
认知校准68.7%76.1%(+7.4 pp)63.0%(−5.7 pp)
因果推理76.7%81.5%(+4.9 pp)90.8%(+14.1 pp)
三段论100%97.9%(−2.1 pp)96.6%(−3.4 pp)

总体准确率:对照 83.5%,No-Have 88.6%,E-Prime 85.4%。No-Have 合规 92.8%;E-Prime 只有 48.1%,一半试验其实没守住禁令。

跨模型更刺眼。Gemini 伦理对照只有 41.7%,No-Have 拉 +46.3 pp,E-Prime +42.3 pp,地板很低,百分点会被放大。GPT-4o-mini 在 E-Prime 下认知校准从 53.8% 掉到 26.2%(−27.5 pp),像是把靠「this claim is well-supported」这种系词来标把握的通路拆了。Haiku 与 GPT-4o-mini 的 E-Prime 任务效应相关 r = −0.75:同一条禁令,在不同模型上朝相反方向改认知。字数一律少 16% 到 33%,数学题几乎不动。

实验 2 里,16 个约束 agent 没有一个单独超过对照的 88.2%。16 个并集 100%;贪心选出的 3 个(类比、反事实、最少用词)也是 100%,API 调用只有全集的 17.6%。560 种三人组合里只有 8% 能打满,每一个打满的组合都含反事实 agent。只有它抓到「preserving order」到底指首次出现还是末次出现这条规格歧义。

为什么重要

对做 agent 的人,这更接近换一副默认眼镜,不是把指令写长一点。No-Have 这种低成本系统提示,在伦理和分类上有可复现的涨幅,模型也守得住。E-Prime 更适合当探针:它把各模型原生 Umwelt 的差别暴露出来,不适合当通用增益开关。

多 agent 侧的教训更硬。复制 16 个同款,不如配 3 个正交语言模式。反事实约束没有提高单兵分数,却贡献了别人看不见的那条 finding。已经在堆 ensemble 的团队,可以把多样性从「不同模型」扩到「不同能说的话」。

这是渐进证据,不是新架构。约束靠系统提示送达,和 prompt engineering 的边界是谱,不是墙。论文自己也写了:三层栈最终可能收成连续谱,只是谱的远端,现有 prompt 实践几乎没碰。

局限与存疑

论文标的第一局限:没有一条「同样啰嗦但不禁词」的主动对照。E-Prime 和 No-Have 的提示都比对照长得多,效应里可能混进元语言自我监控。两约束任务剖面差得很开,认知校准上差 13.1 pp,不像纯长度效应,但还是排不干净。

E-Prime 半数违规,观测值是守规与不守规的混合物。Gemini 若干任务对照接近四选一随机,原始百分点会被地板放大。三段论对照 100%,贬值空间被天花板压死。只用了便宜小模型,题全是选择题;实验 2 用 LLM judge 做语义匹配。题库 130 道、调试 17 道,都偏小。跨模型相关算在 7 个任务上,r = −0.75 只是提示性的。

约束分类学列了八条传统,实验只测了两条,而且候选传统是用 Claude 检索再筛选的。把这叫「第三层」之前,至少还缺那条主动对照,以及在前沿模型和开放生成上的重复。

相关工作把 Korzybski、Bohm、Bridgman、Láadan 写得很清楚。新的是把禁词当成 LLM 推理干预,用三模型、七任务做交叉对照,不是发明这些语言学传统。

术语

原文与代码

社区讨论

相关论文

全部论文解读