新论文:LLM 集群学不会「社会性自我改进」,模仿同伴反伤探索
maxhkw · x · 2026-10-03
Max Kleiman-Weiner 等人发布论文《From Solo to Social Learning: Characterizing Recursive Social Improvement in LLMs》(arXiv:2609.38516),提出与递归自我改进(RSI)相对的「递归社会性改进」概念:当每个 agent 追求自己的奖励时,自我改进的 LLM 能否通过互相学习提升整体水平。
关键发现:
- 实验设定:agent 群体修订各自 skill 文件,自主决定是否、何时、向谁学习;独立搜索、向同伴学习与执行共享同一 token 预算
- 受控环境中,经典社会学习算法能从同伴受益,但三个被测 LLM 都不能:单位 token 收益低于独立学习者,且要么探索过窄、要么 token 耗尽还没行动
- 让模型自己编写和修订 skills 后,观察同伴确实改变了改进方式——一个模型更快找到有用技能,另一个减少私有搜索开销——但都没有在同等成本下胜过独立学习者
- 技能会被复制、修订、传递,一个发现能催生更多搜索;但这些交流使群体集中在更少的独立发现上
结论:模仿同伴的发现以牺牲探索为代价,LLM 尚未掌握人类进步赖以实现的累积文化式社会学习。
「编程与Agent」频道最新
- LangSmith 推出 Custom Apps:用提示词给 Agent 数据搭自定义界面 — LangChain · 2026-10-03
- Addy Osmani 教你写 Claude Code Mods:会话内运行、可改行为画 UI — daniel_mac8 · 2026-10-03
- 十年程序员用 AI 全流程剪片:一周把乱素材变成完整故事 — john__allard · 2026-10-03
- 本地文本分类实操:用 Apple Create ML 给商品自动分类 — airesearch12 · 2026-10-03
- GPT-6 Astra 驱动 agent-wow,40 分钟零死亡通关魔兽新手村 — petrusenko_max · 2026-10-03
- iPhone 变身 MacBook 外挂 GPU:Qwen 27B 预填充提速最多 44% — StayLameBro · 2026-10-03