多智能体 eval 形态未定,colocated 异步 RL 训练正成趋势

stochasticchasm · x · 2026-09-11

作者在读完一篇论文后总结:多智能体 eval 是最有意思的部分——multi agent harness 可能有非常多的形态,最优方案仍无定论,但针对它做训练看起来明确有益,且比单智能体更可扩展。

他还注意到 colocated async RL 正在流行,k3 也采用了同样的做法,觉得既合理又有趣。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →