Kimi 研究:只练 1465 个 PDF 任务,通用能力也翻倍
echen · x · 2026-09-30
一项新研究探索:在广为使用的前沿评测 GDP.pdf 的底层技能上做训练,模型是只学会「处理 PDF」,还是学到了更本质的东西?
研究者在 1,465 个 GDP.pdf 配套任务上对 Kimi K2.7 做后训练:
- GDP.pdf 成绩从 11.0% 提升到 24.5%;
- 在不含 PDF 的 GDPval 上,完整任务成功率翻倍以上,90% rubric 通过率提升 +13.2 个百分点——测试环境包含文件、工具、表格和最终交付物。
为什么能迁移? 轨迹分析显示:训练前的 Kimi 常抓到第一个看起来合理的来源就开始干活;训练后它会先环顾环境——这里有什么、什么重要、有没有遗漏。一个案例中,基础模型打开第一份周工时表就急着算月报(错误),训练后的模型先找齐全部四周再合并计算。
作者的解释框架:PDF 是一个微型的「证据环境」,好的专业 PDF 逼你搞清事实在哪一节、哪些图表重要、证据是否充分。训练让模型养成了先收集全部证据再行动的习惯,即使任务离开 PDF 依然保留。
所属事件:Kimi 研究:仅训 1465 个 PDF 任务即可大幅提升通用能力(2 条相关)→
「模型」频道最新
- OpenAI Ultrafast 模式开放:API 全员可用,Pro 500 档同步上线 — OpenAIDevs · 2026-09-30
- 实测算账:$100 Claude + $200 Codex + $30 Grok 混搭订阅更划算 — codtv132 · 2026-09-30
- 智能价格每 2 周砍半?企业客户已不知该预算哪个模型 — gabriel1 · 2026-09-30
- Reddit 用户报告 Codex 连接超时,状态页尚未显示故障 — ahriad · 2026-09-30
- OpenAI 推出 Ultrafast 极速档:Codex 最高 300 tokens/秒、快 8 倍 — OpenAI · 2026-09-30
- OpenAI 重开 Pro 200 订阅,并承诺不再恢复 5 小时限额 — OpenAI · 2026-09-30