LAC 论文:把架构重负移到 critic,机器人 RL 推理延迟降 4 倍
heghbalz · x · 2026-09-05
一篇针对离线强化学习盲点的新论文质疑:为何 actor 要背负扩散/流匹配模型的慢推理,而训练后被丢弃的反而是 critic?
- 现实机器人控制中,每步决策多次去噪会摧毁控制频率
- LAC 把架构负担移到训练阶段:用残差 MLP 骨干、n-step bootstrap 目标与 categorical cross-entropy 稳定深层 critic,避免离线场景下常见的优化崩溃与 bootstrap 漂移
- 有了深 critic 做重活,一个极简确定性 actor 即可在 OGBench 上匹敌重型生成式基线
- 单次前向推理,延迟最多降低 4 倍
「具身」频道最新
- 欧盟 AI 法案人形机器人高风险条款生效,先审计留痕再上岗 — sierracatalina · 2026-09-05
- whurley 首乘 Tesla CyberCab:称 Uber 式网约车生意危险了 — whurley · 2026-09-05
- SEMICON 展会直击:半导体从业者直言「人形机器人很蠢」 — bookwormengr · 2026-09-05
- 格斗机器人训练实拍:强化学习上擂台 — cixliv · 2026-09-05
- 特斯拉:Cybercab 基于 16000 人驾驶时长的数据训练 — yunta_tsai · 2026-09-05
- Figure CEO:不追求单代完美,人形机器人靠代际迭代,F.04 见分晓 — adcock_brett · 2026-09-05