稠密反馈强化学习新方法QVal用于长时程任务
maksym_andr · x · 2026-07-03
研究提出 QVal 方法,将稠密反馈(dense-feedback)重新引入强化学习训练,用于扩展到长时程任务,并对不同方法的表现进行比较。该方向被认为在长时序任务 scaling 上重新受到关注。
「编程与Agent」频道最新
- 开发者把 Claude Code 和 Codex 历史合并成千万级消息归档 — doodlestein · 2026-07-27
- 谷歌 15 个免费 AI 工具覆盖营销、编程和音乐 — aigclink · 2026-07-27
- 9B Ollama Agent 可本地跑电台 DJ:工具、记忆和 TTS — pinku1 · 2026-07-27
- Bugbot 拒绝一个会破坏路径隔离的 MCP 权限标志 — zeeg · 2026-07-27
- 一个 GPT-5.6 agent 在看家,另一个在做恶搞说唱 — repligate · 2026-07-27
- Agent 复用已登录浏览器后,风控问题反而解决了 — armanidev_ · 2026-07-27