Schulman:仅读1930年前文本的模型经蒸馏竟超Claude 3 Opus
victor_explore · x · 2026-09-13
OpenAI 联合创始人 John Schulman 分享了一个蒸馏案例:一个只读过 1930 年以前文本、从未见过代码的模型,仅用 AI 生成的编程示例微调后,竟在编程测试上超过 Claude 3 Opus。
Baseten 的 Charlie O'Neill 则给出了该方法的失败边界。victorexplore 指出核心变量是师生能力差距:"廉价蒸馏在差距小时有效,差距大时失效,因此投入应放在搭建梯级(逐级蒸馏)上,而不是一次大规模微调。"
「模型」频道最新
- kalomaze 直言 Opus 5 是个很糟糕的模型 — kalomaze · 2026-09-13
- 陈天奇转发式吐槽:AA-intelligence 基准题自己都看不懂 — WenhuChen · 2026-09-13
- 评论人:OpenAI 数学证明若出自无名数学家,舆论会是另一番景象 — skdh · 2026-09-13
- GPT-6 Astra 不进聊天框:20 美元 Plus 每 5 小时仅 5-45 条,入口成新权限墙 — 新智元 · 2026-09-13
- LLM Architecture Gallery:一张图看尽各家大模型架构 — zainhas · 2026-09-13
- DeepSeek-V4.1-Flash 全量上线 Ollama 云:零数据留存、错峰计价 — johnseach · 2026-09-13