Daniel Hanchen 2 小时 workshop 讲开源模型、reward hacking 和 RL
danielhanchen · x · 2026-07-21
Daniel Hanchen 发布了一场 2 小时 的 workshop,内容包括:
- 开源 vs 闭源模型,以及推理能力是否改变了模型进步速度
- 推理服务商的吞吐优先 与准确率下降之间的权衡
- Benchmaxxing、作弊与 benchmark 可靠性,涉及 METR、WeirdML、Deep-SWE、FrontierCode、SWE Bench Pro 等
- 蒸馏、RL 与 reward hacking,以及如何检测和抑制
- 动态量化,以及为什么软件优化有时比硬件更关键
他还提出,reasoning 的出现可能把模型能力翻倍周期从约 7 个月 缩短到 3.5 个月,并提到开源可能面临的监管风险。
所属事件:Daniel Hanchen发布两小时开源模型与RL工作坊(2 条相关)→
「编程与Agent」频道最新
- FDE 不是只写代码,而是审计、评测、交付三步走 — blaizedsouza · 2026-07-22
- 实测438次:AI编程智能体倾向“自己造轮子”而非选用第三方数据库 — cramforce · 2026-07-22
- Tenable 联手 AWS 办黑帽构建赛,做安全智能体和 MCP — Dave_Maynor · 2026-07-22
- Codex 参与打造开放世界游戏,能攀爬滑翔还坐缆车 — Dimillian · 2026-07-22
- HeyGen 给 coding agent 接入 7.5 万图片和 1 万音乐 — HeyGen · 2026-07-22
- Agent 搜索瓶颈正在从速度转向延迟稳定性 — rohanpaul_ai · 2026-07-22