预训练构建表示,后训练诱导元策略
Liu_eroteme · x · 2026-08-27
帖子讨论了预训练与后训练的区别,提出预训练主要构建观察和策略表示,而后训练则诱导一种表示和策略选择的“元策略”。这解释了强化学习中的某些现象。
「研究」频道最新
- 开源两大新基准:测试 AI 在意图展开与计划变更中的表现 — AIwithGhotai · 2026-08-28
- 蛋白质语言模型 ESM 之父 Alex Rives 入选 TIME100 AI 榜单 — proteinrosh · 2026-08-28
- 分层字节语言模型新论文:动态多字节预测提速推理 — madeofAjala · 2026-08-28
- Jeff Dean 新项目 DiscoveryLoop:把蒸馏迭代哲学搬进科学实验 — agihouse_org · 2026-08-28
- Google Pi 团队新研究:多智能体合作如何涌现智能 — blaiseaguera · 2026-08-27
- Google 研究副总裁:意识本质上是社会性的,AI 意识问题由此可解 — blaiseaguera · 2026-08-27