岗位描述(节选)
1、设计并实现 VLA / Embodied VLM / World Model 的训练目标、分布式训练方案与数据 recipe,融合互联网图文、视频、3D / 仿真、真机轨迹等多源数据;
2、设计并实现融合视频生成与动作控制的多模态大模型架构,探索大规模数据缩放定律,利用海量互联网视频数据及机器人采集数据,提升模型在零样本场景下的任务泛化能力;
3、研发基于 VLM 的端到端导航与具身 Agent 算法;
4、构建具身大模型的评测基准与真机闭环验证 pipeline;
5、跟踪并复现 SOTA 工作,与训练 / 推理 / 数据 / 硬件团队协同迭代
1、CV / ML / 机器人 / AI 相关方向博士,或同等研究能力的硕士;
2、在 VLM / 多模态大模型 / 视频理解 / 3D 视觉 / VLN / Embodied Agent / RL / 视频生成 / 世界模型 任一方向有扎……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。