LoRA+GRPO 微调 8B 模型仿写名家博文,骗过全部商用 AI 检测器

OtherRaisin3426 · reddit · 2026-08-28

作者将开源 Qwen3-8B-Base 用 LoRA SFT + GRPO 两阶段微调,学习某知名 ML 作家的博客文风(约 39 万词公开人类文章),并搭建了一个「写作图灵测试」网页:10 段文字中一半为真、一半由模型生成。

关键结果:所有商用 AI 检测器都无法识别这些生成段落(Pangram 10 段 0 标记)。GRPO 采用复合奖励:风格判别器 + 与真实段落对比的 pairwise judge,且判别器在新生成的 rollout 上持续重训,防止模型钻冻结分类器的空子。

可在线试玩:turing-writing-test.vercel.app。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →