用 Qwen3-4B 做 RL harness 复现,测试从 TREC 32K 迁移到 256K
ben_burtenshaw · x · 2026-07-23
这是一个把论文思路拆成最小可复现实验的项目,核心问题是:harness 本身能否泛化。
- 作者用 Qwen3-4B、TRL GRPO 和 OpenEnv REPL 搭了一个尽量简洁的复现版本,目标是让大家能在单机单脚本里直接尝试。
- 训练数据是 TREC 32K,测试则看这种方法能否迁移到 TREC 256K 和 spam 128K。
- 他的思路不是完整复刻原论文,而是保留关键机制:
- 只在短上下文上训练;
- 长输入不放进主上下文;
- 通过 RL 学习“根分解”;
- 在更长或跨域输入上保持不变地评估。
- 后续回复补充说,这个版本还没做论文里的 trajectory-similarity 指标,属于“可玩、可改”的工作版复现。
所属事件:开发者基于 Qwen3-4B 构建 RL harness 可运行原型(2 条相关)→
「编程与Agent」频道最新
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11