实测:用 GRPO 微调 Qwen 和 Gemma 写新闻效果超 Claude

ivan_bezdomny · x · 2026-08-13

开发者 @ivanbezdomny 分享了使用 GRPO(一种强化学习方法)微调开源模型用于新闻写作的实践经验。

他表示,通过 GRPO 微调 Qwen 和 Gemma 4 模型,在新闻写作的排版和清晰度上,取得了比单纯使用 Claude 或 GPT 加上提示词更好的效果。他正在撰写一篇更新的博客来详细分享这一方法。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →