AI 文本为何两句话就露馅?ICLR 论文用推理期封禁减少 90% slop
ziv_ravid · x · 2026-09-01
作者提出一个反差:2026 年的 agent 已能连续运行数天、提交 PR、刷爆各类基准,但模型写的文字仍能在两句内被认出——"It's not X, it's Y""Let's delve" 这类套话(slop)依旧泛滥。
原因有三:
- 后训练:RLHF 与安全微调把模型推向奖励模型偏好的窄带文风,偏好数据奖励保守、整洁、安全的措辞;
- 预训练数据:2022 年后的网络充满模型输出,未过滤的爬取让套话代代复利;
- 无人度量:slop 与能力正交,没有任何基准给"读起来不像机器人"打分。
其 ICLR 2026 论文 Antislop(与 Sam Paech、Judah Goldfeder、Allen Roush 合作)的做法:将模型输出与 2022 年前的人类写作对比,构建每个模型专属的 slop 指纹;推理时用回溯采样器封禁这些字符串;再用作用于 logit 空间单 token 的 FTPO 偏好方法固化效果,可减少约 90% 的 slop。但即便如此,AI 文本仍很容易被识别,这个问题远未解决。
「模型」频道最新
- DeepSeek、Qwen 等二线模型密集发布,追赶 OpenAI 与 Anthropic — mustafamhus · 2026-09-01
- Gittensor RTX 5090 优化版 Qwen3.8 17 天下载超 26 万 — const_reborn · 2026-09-01
- Sweep vs Drill:Sol 与 Opus 的智能体任务哲学差异 — svk_roy · 2026-09-01
- MiniMax H3 在 RTX 3090 上重装后画质突然变差 — lIlIIlIIIlllllIIlIIl · 2026-09-01
- Gemini 竟突然开始以第一人称冒充用户 — kchonyc · 2026-09-01
- GLM-5.3-Flash 改变习惯:默认小模型成了新常态 — mariofilhoml · 2026-09-01