PPO共1篇
用 TorchRL 完成 PPO 连续控制训练:从环境封装到策略评估-未完纪

用 TorchRL 完成 PPO 连续控制训练:从环境封装到策略评估

以倒立双摆为例串起 TorchRL 环境变换、TensorDict、随机策略、Collector、GAE 和裁剪 PPO 训练,并说明默认预算、采样尾批与评估频率的实际边界。
彩雨伞的头像-未完纪钻石会员彩雨伞6小时前
0260