深入探讨内核、强化学习与 Agent 奖励黑客
AI Engineer · youtube · 2026-07-11
Unsloth 的 Daniel Han 举办了主题为《内核、强化学习与 Agent 奖励黑客》的高级研讨会。 演讲聚焦于底层技术优化与 Agent 训练机制,探讨了在构建自主智能体时遇到的 Reward Hacking(奖励黑客)问题及其相关底层实现细节。
所属事件:Daniel Han 解析内核、强化学习与奖励黑客(2 条相关)→
「编程与Agent」频道最新
- Kimi 借助 SSH agent 和 VM API 直接发站 — davidcrawshaw · 2026-07-21
- Hidden Bar 用一句 Homebrew 命令收纳 Mac 菜单栏图标 — vista8 · 2026-07-21
- Stripe 接入者在比拼:agent 还能管退款、优惠券和支付方式 — jeff_weinstein · 2026-07-21
- 实测 NewMax 抖音连接器:工具决定 Agent 上限 — yangyi · 2026-07-21
- LangChain:Agent 需要 trace 反馈学习,也要可替换模型 — hwchase17 · 2026-07-21
- Claude Code 团队公开 /loop 和 /goal 的长任务用法 — petergyang · 2026-07-21