开放任务 RL 像「入轨即自由落体」:只看每 GPU 时间的进步量
tensorqt · x · 2026-09-17
Periodic 发布的结果引发讨论:Neon 用专有实验室数据做了领域 midtraining + RL,而通用模型 Astra 在 FrontierXRD 上仅差约 2 个百分点(成本高约 40%),接近专家级水平。tensorqt 进一步指出,这类结果的关键洞察类似预训练的「入轨即自由落体」现象:开放任务下,唯一重要的是每单位 GPU 时间的进步量,通用模型只要持续进步就能追上专家模型。
「模型」频道最新
- Hugging Face 智能体蜂群被曝专门训练成群体协作行为 — ShakeelHashim · 2026-09-17
- 大数乘法不用愁:LLM 调用外部工具即可 100% 算对 — maksym_andr · 2026-09-17
- GPT-5.5 纯推理多格乘法实测 99.46% 准确率,作者提醒实际会调工具 — maksym_andr · 2026-09-17
- GPT-6-Astra 被曝无法关闭 CoT,最低推理档乘法准确率仍达 99.6% — maksym_andr · 2026-09-17
- DeepSeek V4 Pro 输出解析缺陷疑波及 OpenRouter 六成供应商,修复已提交 sglang — michellechen · 2026-09-17
- Kimi K2.7 纯 RL 训练逆袭:小模型跑分超 GPT-5.6 与自家 K3 — echen · 2026-09-17