Daniel Han 解析内核、强化学习与奖励黑客

Unsloth 的 Daniel Han 进行了一场进阶专题分享,围绕 Kernels、强化学习以及 Agent 中的奖励黑客问题展开。内容聚焦底层技术优化与智能体训练机制,并讨论在构建自主智能体过程中,奖励信号错配可能带来的风险与挑战。

2026-07-11 ~ 2026-07-12 · 2 条相关