多智能体 eval 形态未定,colocated 异步 RL 训练正成趋势
stochasticchasm · x · 2026-09-11
作者在读完一篇论文后总结:多智能体 eval 是最有意思的部分——multi agent harness 可能有非常多的形态,最优方案仍无定论,但针对它做训练看起来明确有益,且比单智能体更可扩展。
他还注意到 colocated async RL 正在流行,k3 也采用了同样的做法,觉得既合理又有趣。
「模型」频道最新
- OpenAI 内部模型被称已证明 Navier-Stokes 千禧年难题 — QuintinPope5 · 2026-09-11
- 曝 DeepSeek 4.1 flash 也用超大 ngram 词嵌入,架构酷似 Qwen4 — ccerrato147 · 2026-09-11
- ValsAI 发布 RSI Index:首个第三方基准测试模型自研继任能力 — JenniferHli · 2026-09-11
- Assistant Benchmark 上线:61 款 AI 助手 15 个维度实测横评 — Scobleizer · 2026-09-11
- 实测者评 Devin 新模型:非最强但执行力强,$20 订阅超值 — brandon_galang · 2026-09-11
- Business Insider 问 ChatGPT、Gemini、Claude、Grok:AI 如何毁灭人类 — coinfanking · 2026-09-11