循环深度论文:同一层跑两次可获得 1.38 倍等效参数
scaling01 · x · 2026-09-02
介绍新论文 《How Much Is One Recurrence Worth? Iso-Depth Scaling Laws for Looped Language Models》,研究循环深度(looped/recurrent depth)语言模型的等效参数缩放规律。
作者补充的关键推论:
- 另一篇 recurrent depth 论文发现,同一循环块多跑一次约等于 1.38× 等效参数乘数
- 若采用类似 Recirculation 的方案,预训练计算量和解码延迟不变,但推理 FLOPs 与 prefill 延迟增加
- 由此推算 OpenAI 理论上可以训练一个 10T 参数的 recurrent depth 模型,表现相当于 13.8T 模型;或 7.25T 参数等效约 10T
所属事件:OpenAI Astra 被曝采用循环深度架构,隐藏思考过程引安全担忧(34 条相关)→
「模型」频道最新
- OpenAI 网络安全模型 Astra 曝光:ExploitBench 满分 — LingmingZhang · 2026-09-02
- OpenAI 被指采用“循环深度”推理法,引发安全界担忧 — sjgadler · 2026-09-02
- 用户反馈 Claude Code 系统提示词疑似升级,性格更收敛 — ivan_bezdomny · 2026-09-02
- 用户反馈 DeepSeek V4 Pro 出现严重答非所问 Bug — gefei55 · 2026-09-02
- 在 48GB Mac 上运行 104B Qwen3 模型,速度约 12 tok/s — yogthos · 2026-09-02
- GLM-5.3 推理速度达 310 tok/s,编码能力媲美 Opus — Yuchenj_UW · 2026-09-02