Sebastian Raschka 推理系列第五讲:对数概率打分与自我修正
rasbt · x · 2026-09-26
Sebastian Raschka 发布「Reasoning from scratch」系列第 5 期视频,主题为对数概率打分与 LLM 自我修正机制。
核心内容
- 对数概率打分:讲解 token 概率与序列似然,为什么它是预训练/蒸馏中 cross-entropy 等损失函数的基础概念,并演示在 PyTorch 中计算 token 概率、目标位移与数值稳定性处理。
- 答案评分:从规则打分器入手,过渡到用平均对数概率对模型多个答案做排序。
- 自我修正循环:先生成批评意见,再基于批评修改答案,完整实现 self-refinement 流程。
- 评测:在 MATH-500 上给出实验结果与要点总结。
视频含完整代码实操章节,附有详细时间戳,适合想从零理解推理时扩展的工程师。
所属事件:Raschka推理系列第五讲聚焦对数概率打分与自我修正(3 条相关)→
「模型」频道最新
- Decision Index 0.2.1 更新:修复 SGD 基准缺陷并调整类目权重 — multimodalart · 2026-09-26
- Aider 作者吐槽:出钱养实验室却被护栏告知代码该怎么写 — zeeg · 2026-09-26
- AI 长帖为何讨赞:LLM 学会了优化人类偏好的「slop 体」 — AymericRoucher · 2026-09-26
- GPT-6 Sol 对比 Opus 5.5:Sol 行文更精炼,Opus 点题偏慢 — every · 2026-09-26
- Liquid 团队谈端侧 Agent 模型:真正的关键在后训练 — alexcovo_eth · 2026-09-26
- 被指 Opus 5.5 遭暗改降智,NerfBench 将发布首日与复测对比 — CurieuxExplorer · 2026-09-26