开发者基于 Qwen3-4B 构建 RL harness 可运行原型

有开发者使用 Qwen3-4B、TRL GRPO 和 OpenEval 尝试复现论文中的强化学习 harness,并测试了从 TREC 32K 到 256K 的上下文迁移能力。作者澄清,这并非论文的完整复刻,而是一个方便大家进行调试和探索的最小化可运行原型,核心在于验证 harness 本身的泛化机制。

2026-07-23 ~ 2026-07-23 · 2 条相关