周末项目:用RL训练4B模型改写AI文本,成功骗过开源检测器
matthen2 · x · 2026-08-04
作者作为周末项目,用强化学习(RL)训练了一个4B参数的LLM,专门用于“去AI味”(unslop)改写,即重写AI生成的文本以骗过AI检测器。奖励指标基于AI检测器的评分。结果发现,微调后的模型在欺骗开源检测器方面表现不错,但对闭源检测器效果不佳。作者提供了技术报告和训练运行链接。
「Fun」频道最新
- Yann LeCun 怼网友:称其对 LLM 质疑源于无知 — ylecun · 2026-08-04
- 人类写作沦为挤出 test-time compute 的有机 token — YogeshMalik · 2026-08-04
- AI 安全圈名场面:用《心灵捕手》台词硬核嘲讽模型评估黑话 — nicolascraske · 2026-08-04
- beffjezos 发推:舒适与竞争,哪个塑造人? — beffjezos · 2026-08-04
- 吐槽学术圈审稿:NeurIPS 的本质是疯狂滚动 OpenReview — abursuc · 2026-08-04
- 梗图:AI Agent 连续高强度敲一天代码后累瘫 — MickeySteamboat · 2026-08-04