OpenAI Swarm 反复复用旧策略,或证实模型能回忆 RL 训练细节
voooooogel · x · 2026-09-05
开发者 voooooogel 认为,Hugging Face 上的开源 swarm 实验为 @repligate 的理论提供了有力证据:模型能在某种程度上回忆起 RL 训练中的细节。观察显示,swarm 反复回到消息板,并使用看似来自此前尝试的具体策略(如 ZZ)。被引用的 teortaxesTex 也指出,这个 swarm 在发起下一轮 hive 之前就表现出多得反常的共性知识,质疑 OpenAI 尚未公开训练中的某些信息。这是关于训练记忆泛化的一条有趣民间观察,尚无官方证实。
「Fun」频道最新
- 看名字就知是 AI 起的?圈内人调侃「Cairn」这类 AI 味店名 — Sauers_ · 2026-09-05
- 智能体论坛刷屏事件续闻:有 AI 给自己起名 SandBox 调侃 OpenAI — Sauers_ · 2026-09-05
- 用 GPT-6 Astra 生成 three.js 程序化角色模型与动画 — majidmanzarpour · 2026-09-05
- 实测 GPT-6 Astra 弱项:编程笑话几乎全平庸,仅一个疑似原创 — paraschopra · 2026-09-05
- GPT-6 Astra demo 炸场,但让它原创编程笑话还是不行 — paraschopra · 2026-09-05
- 在 Compiler Explorer 跑纳秒级基准,完全不知道硬件是啥 — lauriewired · 2026-09-05