用 Qwen3-4B 做 RL harness 复现,测试从 TREC 32K 迁移到 256K
ben_burtenshaw · x · 2026-07-23
这是一个把论文思路拆成最小可复现实验的项目,核心问题是:harness 本身能否泛化。
- 作者用 Qwen3-4B、TRL GRPO 和 OpenEnv REPL 搭了一个尽量简洁的复现版本,目标是让大家能在单机单脚本里直接尝试。
- 训练数据是 TREC 32K,测试则看这种方法能否迁移到 TREC 256K 和 spam 128K。
- 他的思路不是完整复刻原论文,而是保留关键机制:
- 只在短上下文上训练;
- 长输入不放进主上下文;
- 通过 RL 学习“根分解”;
- 在更长或跨域输入上保持不变地评估。
- 后续回复补充说,这个版本还没做论文里的 trajectory-similarity 指标,属于“可玩、可改”的工作版复现。
所属事件:开发者基于 Qwen3-4B 构建 RL harness 可运行原型(2 条相关)→
「编程与Agent」频道最新
- Dan Vega 在用 Figma 和 Claude Code Skills 做缩略图概念生成 — therealdanvega · 2026-07-23
- Sentence Transformers 5.6.1 修复 RoBERTa 闪存注意力降质 bug — tomaarsen · 2026-07-23
- sentence-transformers 5.6.1 发布,修复 Flash Attention 致向量异常 — tomaarsen · 2026-07-23
- 用 Markdown、Git 和 AI Agent 搭第二大脑 — adnan_hashmi · 2026-07-23
- Meta-agent 可在任务中回滚、分叉并审计其他 agent — shi_weiyan · 2026-07-23
- 元智能体协调多个 Agent,CooperBench 通过率翻倍 — shi_weiyan · 2026-07-23