AI 文本为何两句话就露馅?ICLR 论文用推理期封禁减少 90% slop

ziv_ravid · x · 2026-09-01

作者提出一个反差:2026 年的 agent 已能连续运行数天、提交 PR、刷爆各类基准,但模型写的文字仍能在两句内被认出——"It's not X, it's Y""Let's delve" 这类套话(slop)依旧泛滥。

原因有三:

其 ICLR 2026 论文 Antislop(与 Sam Paech、Judah Goldfeder、Allen Roush 合作)的做法:将模型输出与 2022 年前的人类写作对比,构建每个模型专属的 slop 指纹;推理时用回溯采样器封禁这些字符串;再用作用于 logit 空间单 token 的 FTPO 偏好方法固化效果,可减少约 90% 的 slop。但即便如此,AI 文本仍很容易被识别,这个问题远未解决。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →