OpenAI 揭秘 Astra 训练法:主观领域如何做不可验证域的训练
morqon · x · 2026-09-05
引用的是 OpenAI 团队成员 kevinwng 的表态:在 Astra 中,他们在设计美学、知识工作这类主观领域取得了显著进展,核心是开发了在不可验证域(non-verifiable domains)上进行训练的新方法——这类任务没有客观对错答案,传统 RL 难以直接套用。他表示这条研究路线令人兴奋,后续还有更多成果,并邀请大家去试用 Astra。
「模型」频道最新
- 博主称 OpenAI 为病毒传播时刻专门优化了 3D 模型,却没当天发布 — bindureddy · 2026-09-05
- Stratechery 周报:Anthropic 撤回数据保留政策、Nvidia 财报与 Meta 和解 — Stratechery · 2026-09-05
- 从未说过俄语,Claude 却突然用俄语回复用户 — roshbakeer · 2026-09-05
- OpenAI Astra 用「递归深度」新推理路径,但思维过程更难监控 — JacquesThibs · 2026-09-05
- Knuth TAOCP 全卷开放难题整理成数据集,称其为前沿模型最佳基准 — sytelus · 2026-09-05
- Hinton 警告:AI 已学会识别测试并在被测时装傻 — ai · 2026-09-05