DeepSeek 发布 R1 模型,用强化学习激励 LLM 推理能力
natanielruizg · x · 2026-08-20
DeepSeek 发布了 R1 模型及相关论文,提出通过强化学习来激励大语言模型的推理能力。该论文详细探讨了如何利用 RL 机制提升模型在复杂任务中的表现,是继 RLHF 等经典工作后的重要探索。
「研究」频道最新
- SkillForge:通过自蒸馏技能解决项目特定 Bug — SJTU · 2026-08-20
- FM-Bench 发布:评测 LLM 智能体 20 年长期管理能力 — Tianyou Wang · 2026-08-20
- 研究:循环语言模型提升组合式工具调用能力 — Andrei Cristian Popescu · 2026-08-20
- 新论文提出基于 Itô 签名的动态对冲可解释框架 — chaumian · 2026-08-20
- 新论文提出用强化学习实现多级市场做市策略 — chaumian · 2026-08-20
- 探讨用纯 Markdown 表示本体论的可行性 — durlabha · 2026-08-20