Qwen3-4B harness 复现只是可运行原型,不是完整论文复刻
ben_burtenshaw · x · 2026-07-23
这条回复主要是在澄清复现实验的边界。
- 作者强调:这不是论文的完整复刻,而是一个能跑起来、方便大家 tinkering 的工作版复现。
- 核心机制仍然是:
- 只在短 TREC 上训练;
- 长输入不进主上下文;
- 用 RL 学习 root decomposition;
- 再直接拿去测更长或跨域输入。
- 他还补充了几个简化前提:
- 用更小的模型;
- subcaller 冻结;
- 策略训练更短;
- subcall budget 更低。
- 另外,论文里的 trajectory similarity 指标目前还没算。
所属事件:开发者基于 Qwen3-4B 构建 RL harness 可运行原型(2 条相关)→
「编程与Agent」频道最新
- Dan Vega 在用 Figma 和 Claude Code Skills 做缩略图概念生成 — therealdanvega · 2026-07-23
- Sentence Transformers 5.6.1 修复 RoBERTa 闪存注意力降质 bug — tomaarsen · 2026-07-23
- sentence-transformers 5.6.1 发布,修复 Flash Attention 致向量异常 — tomaarsen · 2026-07-23
- 用 Markdown、Git 和 AI Agent 搭第二大脑 — adnan_hashmi · 2026-07-23
- Meta-agent 可在任务中回滚、分叉并审计其他 agent — shi_weiyan · 2026-07-23
- 元智能体协调多个 Agent,CooperBench 通过率翻倍 — shi_weiyan · 2026-07-23