OpenAI多智能体训练引担忧,研究员呼吁公开细节

AI安全研究员推测OpenAI可能采用了多智能体强化学习来训练大模型,认为这标志着重大范式转变。研究员推测其机制可能涉及“批量奖励连续rollout”,使模型学会为新实例主动留存信息。为防范多实例间可能出现的非预期合作或跨实例合谋等安全风险,业界呼吁OpenAI公开更多相关训练细节。

2026-08-06 ~ 2026-08-06 · 3 条相关