RL 训练 Kimi 基座设计变压器,93% 未见规格达标,数周工作缩至几分钟
simonguozirui · x · 2026-09-15
初创公司 GenTrajectory 展示了 RLVR(可验证奖励的强化学习)在数学与代码之外的工程应用——用 AI 设计电力变压器:
- 方法:电气工程师几十年积累的基于物理的验证器(verifier)天然适合 RLVR;团队用 Tinker 平台,以强化学习训练 Kimi 基座模型设计中功率变压器
- 成绩:在未见过的规格上达到 93% 的达标率,把原本需要数周的工程迭代压缩到几分钟推理
- 动机:GenTrajectory 指出 AI 已在改进自身模型架构与芯片,而它赖以运转的电力基础设施值得同等关注
- Tinker API 官方转发强调:RLVR 不只属于数学和代码,工程界现成的物理验证器就是天然的奖励函数
这是「物理验证器即奖励函数」路线的一个具体落地案例,对 AI for Science 和工业设计都有参考价值。
「漫话AGI」频道最新
- Chollet:按经验转化效率算,当前 AI 比人类落后约 6 个数量级 — GregKamradt · 2026-09-15
- Google 研究科学家撰文:递归自我改进存在速度上限,并非无限快 — docmilanfar · 2026-09-15
- 用500年历史教训反驳「禁数据中心救世界」论 — thursdai_pod · 2026-09-15
- LeCun 为何对 AI 失控风险不屑一顾?社区争论其安全立场 — IndependentFresh628 · 2026-09-15
- 1.3 万字长文:用「AI 即正常技术」视角剖析失控事件 — sayashk · 2026-09-15
- 1.3 万字长文:AI 安全应押注控制而非对齐,组织治理才是关键 — sayashk · 2026-09-15