开发者基于 Qwen3-4B 构建 RL harness 可运行原型
有开发者使用 Qwen3-4B、TRL GRPO 和 OpenEval 尝试复现论文中的强化学习 harness,并测试了从 TREC 32K 到 256K 的上下文迁移能力。作者澄清,这并非论文的完整复刻,而是一个方便大家进行调试和探索的最小化可运行原型,核心在于验证 harness 本身的泛化机制。
2026-07-23 ~ 2026-07-23 · 2 条相关
- 用 Qwen3-4B 做 RL harness 复现,测试从 TREC 32K 迁移到 256K — ben_burtenshaw · 2026-07-23
- Qwen3-4B harness 复现只是可运行原型,不是完整论文复刻 — ben_burtenshaw · 2026-07-23