全靠 Codex 探索,研究者一篇循环模型长度外推论文诞生
qixing_huang · x · 2026-09-10
Hanwen Jiang 分享了与 Codex 高度自动化协作完成研究项目的经历:分工是 Codex 负责最大化探索——提出假设、实现与调试方法、跑实验、分析结果并根据反馈迭代;研究者本人负责判断——定方向、选题、核查证据、决定哪些想法值得追。
他认为这种工作流在问题接近纯逻辑、每个假设可用少量算力验证时尤为有效:agent 可高吞吐探索,廉价验证带来快速迭代。
成果是论文《Learning Length-Extrapolatable Recurrent Models》:研究循环模型长度外推受限的原因,指出关键在于 state credit(未来损失抵达早期循环状态的信号),提出 CST(Credit Stabilization through Time)在反向传播时局部重缩放 state credit 信号以稳定其范数,在合成任务与真实数据上均将性能提升至训练长度的最多 128 倍。
「编程与Agent」频道最新
- K3 优化 mjwarp 内核提速 77%,GPT-6 再优化仅 0.38% — YouJiacheng · 2026-09-10
- K3 优化 mjwarp 内核提速 77%,GPT-6 Astra 再优化仅 0.38% — YouJiacheng · 2026-09-10
- 同一份异步程序七种输出:Async/Await 跨语言差异远超预期 — IanArawjo · 2026-09-10
- 开发者感叹:模型越聪明,要审的 AI 生成 PR 也越难跟上 — smlpth · 2026-09-10
- Automattic 推 agent 即时托管 here.now,3 秒发布已承载 50 万站点 — iannuttall · 2026-09-10
- mitsuhiko 实测 Google Astra:很惊艳,但还不敢用于日常工程 — mitsuhiko · 2026-09-10