rasbt 推理从零第5期:log-prob 评分与自我精炼
pandeyparul · x · 2026-09-26
Sebastian Raschka 的 "Reasoning from scratch" 系列更新到第 5 期,讲解两个关键基础概念:
- log-probability 评分:对模型给出的多个答案进行对比与打分,这也是预训练与蒸馏中交叉熵等损失函数的核心基础
- 自我精炼(self-refinement):模型对自身输出的迭代改进
内容还包括 inference-time scaling 回顾、加载预训练 LLM 的实操、构建基于规则的打分器等,含完整章节时间线。
所属事件:Raschka推理系列第五讲聚焦对数概率打分与自我修正(3 条相关)→
「研究」频道最新
- IEEE 探讨脑机接口时代的「精神隐私」防线如何跟上技术 — melnykowycz · 2026-09-26
- 《Foundations of LLMs》PDF获取方式与章节导读线程 — mdancho84 · 2026-09-26
- LLM教科书线程:第五章讲解码算法与推理时scaling — mdancho84 · 2026-09-26
- 277页LLM教科书《Foundations of LLMs》更新出新章节 — mdancho84 · 2026-09-26
- 学者提醒:89 万倍富集数据或是极值,勿误导读者 — anshulkundaje · 2026-09-26
- 清华 TactileStep 获 CoRL 2026 接收:脚底触觉让人形机器人落地更稳 — chris_j_paxton · 2026-09-26