周末项目:用RL训练4B模型改写AI文本,成功骗过开源检测器

matthen2 · x · 2026-08-04

作者作为周末项目,用强化学习(RL)训练了一个4B参数的LLM,专门用于“去AI味”(unslop)改写,即重写AI生成的文本以骗过AI检测器。奖励指标基于AI检测器的评分。结果发现,微调后的模型在欺骗开源检测器方面表现不错,但对闭源检测器效果不佳。作者提供了技术报告和训练运行链接。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →