电机温度进策略:A1负重3公斤连走从7分钟撑过27分钟

Learning Thermal-Aware Locomotion Policies for an Electrically-Actuated Quadruped Robot

Letian Qian, Yuhang Wan, Shuhan Wang, Xin Luo

cs.RO

2026-03-02

华科把电机温度写进四足RL:A1背3公斤以1米/秒平地走,无温度奖励的基线约7分钟过热停,热感知策略连走超26分钟直到没电。

这篇在解决什么

电驱四足能跑复杂地形,电机却在高扭矩循环里攒热。设计手册上的负载和续航,多半按理想散热和中等运动来写。真实任务里温度一旦顶到保护阈值,机器直接降功率或停。机械臂可以把热约束做成限扭矩;四足不行,扭矩同时撑平衡、着地和跟踪指令,热管理和稳定拧在一起。

现有路子一边加散热、浸没、热容,一边把温度塞进固定基座的代价函数。华中科技大学这组要的是:不改硬件,让步态策略自己躲开过热。

方法

他们把 Unitree A1 的全身热网络塞进 Isaac Gym。单电机用一阶热容-热阻,热源主要是绕组焦耳热;全身再加电机之间、机载计算机与环境的耦合,状态是 14 维温度节点。策略 50 Hz,关节 PD 200 Hz,热模型跟策略同频更新,区间内用扭矩 RMS 代替电流当热输入。

观测里直接有 12 路电机温度。Actor-Critic 不对称:Critic 训练时还能看到线速度和外力。编码器吃过去六帧本体感觉,估速度并吐 16 维隐变量,训练分 Hybrid Internal Optimization 更新编码器、PPO 更新 Actor 与 Critic。

温度奖励不直接罚「超 Tmax」。热惯性大,一局里温度掉不下来,初始温度会绑架回报。做法是把「温度低于 60°C」放松成控制障碍函数:靠近阈值时要求温度导数不再向上。只对裁剪到 55–65°C 的温度算违约,权重 2.0,γT 取 0.35。基线就是同一套训练去掉这条温度奖励。

为了让过热在仿真里真的发生,载荷随机 0–4 kg,加上偏心质心、持续外力 ±30 N、摩擦 0.2–1.25、电机强度 0.8–1.2 倍,初始电机温度故意撒在阈值附近,环境温度 0–35°C。8192 个并行个体训 6000 个 epoch,每局 20 秒,任务是平地全向走,地形高度噪声 ±2 cm,缓坡到 2%。

结果

真机后背固定 3 kg,指令 1 m/s 平地连走。

策略设置结果
无温度奖励基线3 kg, 1 m/s左前膝关节电机过热,约 7 分钟停
热感知策略同上走到电池耗尽,连续超过 26 分钟,全部电机低于 Tmax

摘要写成超过 27 分钟。户外没法对齐初始温度,曲线只能看趋势。

机制分析在仿真里加码:躯干左上再挂 4 kg 侧载,仍指令 1 m/s。热感知策略关节行程更小,峰值和 RMS 扭矩都更低;步频更高,但垂直接地力和时间平均冲量与基线相当,水平分力仍然很小。稳态姿态俯仰更大、质心更高。足端雅可比在支撑相的垂直分量大于基线,水平分量略降。四足小跑垂直力远大于水平力,同一扭矩能换到更多垂直接地,热负荷下来,指令跟踪仍在。

为什么重要

这是渐进改进,但打在一个很具体的工程疼点上:四足「能走」和「能走很久」不是一回事。不换电机、不加液冷,只把温度反馈和一条障碍函数奖励写进现成的 PPO 腿控栈,续航从分钟级保护跳闸拖到电池先死。巡检、负重运输这种任务,过热中断往往比峰值速度更致命。

复现门槛也不高。热模型参数来自他们此前的集总热网络工作,训练框架跟 Hybrid Internal Model 那条腿控线接近。有电机温度反馈的平台可以直接试。

局限与存疑

作者自己写了:策略在温度还很低时也走保守姿态,陡坡和楼梯会吃亏,下一步才打算按温度切模式。实验几乎只在平地、1 m/s、单一 3 kg 载荷,没有楼梯、没有高温环境对照,也没有和硬件散热方案比。扭矩、接地力、雅可比的差异都在图里,正文没给百分比。基线只减温度奖励,没有和显式限扭、模型预测控制比。Tmax 取 60°C,和原厂过热保护的真实阈值关系没写清。正文里初始温度范围在「Tmax−35」和表中的「Tmax−25」对不上,读的人需要自己对一下。

术语

原文与代码

社区讨论

相关论文

全部论文解读