Qwen3-4B harness 复现只是可运行原型,不是完整论文复刻
ben_burtenshaw · x · 2026-07-23
这条回复主要是在澄清复现实验的边界。
- 作者强调:这不是论文的完整复刻,而是一个能跑起来、方便大家 tinkering 的工作版复现。
- 核心机制仍然是:
- 只在短 TREC 上训练;
- 长输入不进主上下文;
- 用 RL 学习 root decomposition;
- 再直接拿去测更长或跨域输入。
- 他还补充了几个简化前提:
- 用更小的模型;
- subcaller 冻结;
- 策略训练更短;
- subcall budget 更低。
- 另外,论文里的 trajectory similarity 指标目前还没算。
所属事件:开发者基于 Qwen3-4B 构建 RL harness 可运行原型(2 条相关)→
「编程与Agent」频道最新
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11