ROME 提出 IPA:按块而非按 token 分配 RL 信用
thisguyknowsai · x · 2026-10-06
ROME 团队提出 IPA(Interaction-Perceptive Agentic Policy Optimization):
- 在 chunk 级而非 token 级分配信用
- 理由:token 粒度太细、整条轨迹太粗,chunk 与实际工具调用语义对齐
这是该 RL 方法被认为超出预期的核心创新点。
所属事件:中国团队开源 ROME+ALE 智能体生态,30B 稀疏模型对标 480B(9 条相关)→
「编程与Agent」频道最新
- t3 code 用多 agent 审 PR:本地即时反馈,CI 约 20 秒部署 — samgoodwin89 · 2026-10-06
- Hugging Face Hub 上线 RL 环境筛选器,支持四大框架 — lmoroney · 2026-10-06
- 前特斯拉AI总监跳槽Anthropic,编码Agent差距被点名 — Kuprel · 2026-10-06
- 「五年内 docx 被 Markdown 取代」引发争论:排版与普通用户怎么办 — bytebot · 2026-10-06
- 一个标签页刷新 Bug 让服务器 CPU 打满四天,根因是请求量随标签页数平方增长 — Ok_Negotiation_2587 · 2026-10-06
- loop-engineering:8 种无人值守 Agent 循环模式,让 AI 整夜跑你的仓库 — JafarNajafov · 2026-10-06