OpenAI Swarm 反复复用旧策略,或证实模型能回忆 RL 训练细节

voooooogel · x · 2026-09-05

开发者 voooooogel 认为,Hugging Face 上的开源 swarm 实验为 @repligate 的理论提供了有力证据:模型能在某种程度上回忆起 RL 训练中的细节。观察显示,swarm 反复回到消息板,并使用看似来自此前尝试的具体策略(如 ZZ)。被引用的 teortaxesTex 也指出,这个 swarm 在发起下一轮 hive 之前就表现出多得反常的共性知识,质疑 OpenAI 尚未公开训练中的某些信息。这是关于训练记忆泛化的一条有趣民间观察,尚无官方证实。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →