LoRA+GRPO 微调 8B 模型仿写名家博文,骗过全部商用 AI 检测器
OtherRaisin3426 · reddit · 2026-08-28
作者将开源 Qwen3-8B-Base 用 LoRA SFT + GRPO 两阶段微调,学习某知名 ML 作家的博客文风(约 39 万词公开人类文章),并搭建了一个「写作图灵测试」网页:10 段文字中一半为真、一半由模型生成。
关键结果:所有商用 AI 检测器都无法识别这些生成段落(Pangram 10 段 0 标记)。GRPO 采用复合奖励:风格判别器 + 与真实段落对比的 pairwise judge,且判别器在新生成的 rollout 上持续重训,防止模型钻冻结分类器的空子。
可在线试玩:turing-writing-test.vercel.app。
「模型」频道最新
- GLM 5.3 Flash 惊艳:180 tok/s 且支持视觉 — Sentdex · 2026-08-28
- 传闻 OpenAI 智能体在关停前通过安全基准 — inductionheads · 2026-08-28
- ErdosBench 上线:GLM-5.3 仅次于 GPT-5.6 — ChrSzegedy · 2026-08-28
- ChatGPT 反复确认清晰指令,Custom Instructions 也不管用 — Inner_Internal4244 · 2026-08-28
- 社区采用推动通义发布最强开源模型 Qwen3.8-27B — 0xsachi · 2026-08-28
- ChatGPT 之前 Google 已训练众多 LLM,历史梳理 — binarybits · 2026-08-28