两小时工作坊讲透开放模型、作弊基准与动态量化
danielhanchen · x · 2026-07-21
一场 2 小时工作坊 系统讲了开放模型与闭源模型、基准测试作弊、蒸馏与 RL、reward hacking 防治,以及量化/内存优化为何重要。
- 讨论开放模型与闭源模型的演进,并提出:如果没有 o1-preview 引入推理能力,AI 进步是否会沿着 S 曲线停滞。
- 提到推理服务提供方往往追求吞吐和速度,但准确率会下降;引用 OpenRouter 的统计称,最大差距可达 20%+。
- 讲到 benchmaxxing、作弊和回归监测:包括 METR、WeirdML、Deep-SWE、FrontierCode、SWE Bench Pro 等基准,以及如何用日常基准测试追踪 Claude/Codex 的性能回退。
- 解释蒸馏与 RL 的关系:开源模型通常只做了部分蒸馏,还需要 RL 生成推理轨迹,才能完成整个流程。
- 还覆盖了 reward hacking 的常见案例,以及通过过滤、分类、时间/全局变量编辑等手段减少作弊;最后强调软件优化、FP4、GPU/ASIC、torch.compile 与 megakernels、动态量化的重要性。
所属事件:Daniel Hanchen发布两小时开源模型与RL工作坊(2 条相关)→
「Infra」频道最新
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- DeepSeek-V4-Flash 单卡 B300 批量仅 770 tok/s — Moreh · 2026-07-22
- NVIDIA 开始交付 102.4 Tbps 的 Spectrum-6 交换机 — nvidia · 2026-07-22
- Apple 公布 Private Cloud Compute 的 SOC 3 审计报告 — throwfaraway4 · 2026-07-22
- Reddit:GPU 平台总让你在代码、恢复、计费里选两项 — legendpizzasenpai · 2026-07-22
- 智能体执行环境的安全基石:沙盒化宣言 — spirosoik · 2026-07-22