NVIDIA 后训练模型在 IOI 编程竞赛超越顶级人类选手
nvidia · hf · 2026-09-03
NVIDIA 发布新研究,通过「精选题目+合成推理数据+监督微调+强化学习」的专业化训练管线,打造竞技编程模型,在 IOI(国际信息学奥赛)基准上借助迭代式测试时优化取得超越顶级人类选手的成绩(金牌级表现)。
要点:
- 训练管线包含精选赛题、合成推理链、SFT 与 RL
- 推理时采用迭代测试时优化(iterative test-time refinement)
- 结果超过 IOI 上的人类最高分水平
「研究」频道最新
- F. Chollet 断言 AI 必收敛于符号学习,新论文称 LLM 表征隐含符号结构 — burny_tech · 2026-09-03
- 与 Tetlock 合著新预印本:RL 奖励评分规则如何塑造 LLM 预测能力 — simonguozirui · 2026-09-03
- DeepLoop 论文让循环 Transformer 可稳定扩展,并传前沿模型为 48 层循环两次 — StartupYou · 2026-09-03
- 曝 OpenAI Astra 用「循环深度」省思考Token,监控成盲区 — 新智元 · 2026-09-03
- KAIST 提出 Declarative Attention,让模型自选跳读 KV 缓存 — kaist-ai · 2026-09-03
- Kirin 从野外视频重建 3D 动物运动,构建大规模数据集 — Brian Nlong Zhao · 2026-09-03