【网通社快报】大晓机器人开源3D双手形状重建模型ACE-Ego-Hand
近日,大晓机器人联合香港中文大学多媒体实验室、南洋理工大学、上海交通大学等机构,开源了面向第一视角视频的3D双手形状重建模型ACE-Ego-Hand,并已产出约5000小时训练数据。该模型首次将视频生成模型作为编码器,实现端到端训练,仅需对整段视频进行一次分析,即可输出双手的姿态、形状和3D位置。与依赖逐帧检测、窗口式时序回归或多步骤扩散采样的现有手部模型不同,ACE-Ego-Hand将视频扩散模型改造为几何编码器,通过单次前馈恢复连续的双手3D轨迹,降低推理延迟和误差累积,并利用完整视频片段中的上下文信息恢复被遮挡或暂时离开视野的手形轨迹。传统视频扩散模型通常需多步去噪采样生成中间视频或像素结果后再估计手部姿态,计算成本高且易传播误差。ACE-Ego-Hand省去多步骤去噪过程,不再将视频扩散模型用于像素空间生成,而是将其作为确定性几何编码器。输入视频经VAE压缩后,模型在干净潜变量上进行一次前向传播,从视频扩散Transformer中间层提取时空特征,并送入双向时空解码器,端到端输出双手姿态、形状、可见性和3D空间位置。在单张A100GPU上,ACE-Ego-Hand达到约63.1fps,约为ViDiHand高精度配置下效率的33倍。该模型具备在手部被遮挡或离开视野后推理恢复其运动轨迹的能力,源于其双向时空推理机制。不同于仅基于过去帧预测当前结果的因果模型,ACE-Ego-Hand对整段视频联合分析,不使用因果掩码,在处理某时刻时可同时利用手部消失前和重新出现后的信息,从而推断中间不可见区间的轨迹,保持手部身份和轨迹连续。此外,ACE-Ego-Hand在测试阶段无需显式输入相机内参,仅通过头戴式第一视角视频即可恢复手部在相机坐标系下的度量3D位置,并支持原生鱼眼超广角输入。面对鱼眼图像的径向畸变,模型无需提前标定相机或进行图像去畸变,直接从畸变画面预测像素到三维空间的观测射线,完成度量3D位置恢复。该模型可应用于产线操作数据采集、机器人示教、人工装配过程分析、灵巧手动作重定向和模仿学习数据构建等场景,尤其在手部常被工件遮挡、暂时离开画面及相机快速运动的真实环境中,能减少轨迹中断和手部丢失,为机器人从人类操作视频中学习完整动作过程提供数据基础。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”




