岗位描述(节选)
我们致力于利用大规模人类第一视角视频与机器人交互数据,构建具备物理世界理解、动作生成和跨任务泛化能力的具身基础模型,并通过真实机器人操作验证模型能力。
你将参与以下工作:
1. 研究世界动作模型(World Action Models, WAM)的预训练与迁移方法,探索视频与动作联合建模、视觉表征学习,以及显式动作与潜在动作学习。
2. 研究人类第一视角数据与机器人真机数据的联合训练,包括数据混合比例、训练阶段安排、共享表征,以及跨本体迁移方法。
3. 与数据团队共同完善第一视角数据处理与质量评估流程,开展手部姿态估计、坐标系统一、时序对齐、动作表示转换,研究噪声标签与缺失标签的利用方法。
4. 完成模型微调、真机部署和闭环评测,通过受控实验评估任务成功率、泛化能力、机器人数据效率及推理性能,并推动数据与模型迭代。
我们希望你具备:
- 扎实的深度学习与机器人学习基础,熟练使用 Py……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。