【网通社快报】星尘智能发布在线强化学习框架SmoothRL并公布三项机器人任务测试结果
近日,星尘智能(Astribot)团队发布在线强化学习框架SmoothRL,由王佳楠担任项目负责人。该框架首次将异步在线强化学习(onlineRL)应用于真实高动态投掷任务中,通过将动作划分为CommittedRegion、ExecutionRegion和DiscardedRegion三部分,仅对实际执行的中间段进行策略更新,以解决模型异步推理与真实动作执行不一致导致的复盘偏差问题。团队称该方法为“ReinforceinDeployment”。在AstribotS1机器人上,SmoothRL在三项任务中进行了测试:-动态投掷任务中,成功率从39%提升至94%,评估基于累计250个rolloutepisodes;任务要求机器人根据目标位置调整释放速度,且摆臂过程不可停顿。-给笔戴帽任务中,成功率从8%提升至83%;任务要求双臂将笔与笔帽对齐,允许相对位姿误差小于5mm。-开箱任务中,成功率从30%提升至90%;任务要求将约1mm宽的刀片插入2–3mm宽的箱盖接缝,基础策略存在稳定左偏问题。在线强化学习后,失败模式发生变化:开箱任务中刀片与接缝的左右偏差缩小至1–2mm;给笔戴帽任务的失败主要表现为正确位置附近的小幅错位。在真实自主投掷rollout中,右侧末端执行器的加速度RMS降低52%,jerk(加加速度)降低47%。星尘智能表示,SmoothRL当前存在一定边界:模型推理时间需控制在预设预算内,且方法主要在冻结的基础策略附近进行有限幅度修正;若基础策略偏离正确动作较远,轻量RL模块难以有效纠正。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”




