微软用强化学习训练「夜科学」智能体,科研方向扩展 27.8%
MicrosoftResearch · hf · 2026-09-30
微软研究院发布 AI Night-Scientist 框架,针对 LLM 在开放式科学构想中输出同质化、可预测的问题,用强化学习教模型「何时以及如何」偏离可预测推理。
- 从认知科学出发,把创造力拆成三个轴:行动(做什么、多创新)、过程(何时探索 vs 何时利用)、结果(想法的原创性与有用性)。
- 用 GRPO 在这些轴上训练模型,让模型在训练中接触不同程度与形式的创造力。
- 结果:科学提案多样性提升,研究方向范围扩大 27.8%,贡献类型增加 14.9%;预测引用影响力最高提升 32.0 个百分点,原创性提升 66.2 点。
- 关键发现:这些收益无法靠单纯调高解码温度复现,真正起作用的是「指定追求哪种创造力」的语义引导。
结论是创造力是一种可学习、多层次的能力,可被塑造以帮助研究者触达 LLM 通常不会探索的想法。
「漫话AGI」频道最新
- Agentic 流量大潮将至:不到 1% 消费者用 Agent,企业远未准备好 — omooretweets · 2026-09-30
- Chollet 谈 AGI 通用性测试:能否即时通过 ARC-AGI-(n+1) — fchollet · 2026-09-30
- 纽约时报:本我、自我与超级智能,AI时代的哲学追问 — nytopinion · 2026-09-30
- 实验室 RL→创业公司套壳→官方杀死,GrantSlatton 总结残酷循环 — generativist · 2026-09-30
- Fortune观点:AI写作披露应从是否改成程度量表 — shdw_0x0 · 2026-09-30
- 可解释性顶尖专家 Neel Nanda:别指望我们能救你们于当前轨迹 — burny_tech · 2026-09-30