多智能体 RL 训练让 agent 间通信从拖累变为增益
vaibhavk97 · x · 2026-09-27
作者指出,8 个月前「让 agent 互相对话」普遍被视为性能拖累,但这一局面正在改变:近期模型开始用多智能体 RL 训练,对「有用的消息」给予 credit,使 agent 间通信成为正向能力而非开销。
「编程与Agent」频道最新
- 用 Mercator 搭航班取消监控,每 30 分钟仅花几美分 — jeff_weinstein · 2026-09-27
- Opus 5.5 写代码,GitHub Actions 渲染成 6 分 54 秒短片 — EricBuess · 2026-09-27
- 一条提示词让 Opus 5.5 写出 321 行飞行模拟器游戏 — EricBuess · 2026-09-27
- Claude Opus 5.5 一次生成完整 RPG,图形音频全由模型直接产出 — EricBuess · 2026-09-27
- Mnemos MCP 推进 V3 重构:免配置免多轮调用,还原引擎复杂度 — RileyRalmuto · 2026-09-27
- Opus 5.5 花 23 小时、8 亿 token 重建《魔兽争霸 2》,AI 对战一局约 2.5 美元 — charliermarsh · 2026-09-27