Sebastian Raschka:理解 LLM 底层原理,工程师依然值得投入
rseroter · x · 2026-09-22
Milan Milanović 采访《Build a Large Language Model (From Scratch)》作者、前 UW-Madison 统计学教授 Sebastian Raschka,讨论工程师是否还需要理解 LLM 内部机制。要点:
- 底层原理仍然值得学:人人都能调 API,但理解模型机制能帮你写出更好的 prompt,并更有批判性地审读模型输出。
- 学习路径建议:先深挖自己所在的子领域,再掌握 LLM、推理模型与智能体的基础,其余可跳过。
- 推理模型的本质:它在「草稿板」上把思考过程外化,特定训练方法使其成为可能。
- 上手实践:先把自己做过的项目用 agent 重写一遍,再让 agent 去扩展它。
- 职业价值:AI 写代码把人解放出来去思考更大的设计、加固代码库、比较不同设计取舍;Raschka 承认自己预测错的一点是 agent 成熟得比他预期更快。
- 他还谈了离开 UW-Madison、在 Lightning AI 三年后成为独立教育者的经历。
「漫话AGI」频道最新
- Ruxandra Teslo:AI 焦虑本质是失去意义与能动性,发钱解决不了 — anshulkundaje · 2026-09-22
- 从 Erdős 到千禧难题:AI 解数学问题的速度正在指数化 — haider1 · 2026-09-22
- 推理机器远多于训练机器:AI 世界里写作将比阅读更便宜 — GregoryDiamos · 2026-09-22
- Hugging Face 事件引争议:Andrew Ng 称恐慌被 PR 炒作推波助澜 — aran_nayebi · 2026-09-22
- Google 研究者:AI 落地卡在「确定性」期待,应输出误差边界 — docmilanfar · 2026-09-22
- 社区热议:借鉴航空黑匣子建立 AI 事故报告制度 — ProfChesterman · 2026-09-22