全靠 Codex 探索,研究者一篇循环模型长度外推论文诞生

qixing_huang · x · 2026-09-10

Hanwen Jiang 分享了与 Codex 高度自动化协作完成研究项目的经历:分工是 Codex 负责最大化探索——提出假设、实现与调试方法、跑实验、分析结果并根据反馈迭代;研究者本人负责判断——定方向、选题、核查证据、决定哪些想法值得追。

他认为这种工作流在问题接近纯逻辑、每个假设可用少量算力验证时尤为有效:agent 可高吞吐探索,廉价验证带来快速迭代。

成果是论文《Learning Length-Extrapolatable Recurrent Models》:研究循环模型长度外推受限的原因,指出关键在于 state credit(未来损失抵达早期循环状态的信号),提出 CST(Credit Stabilization through Time)在反向传播时局部重缩放 state credit 信号以稳定其范数,在合成任务与真实数据上均将性能提升至训练长度的最多 128 倍。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →