岗位描述(节选)
【岗位职责】
- 负责具身基础模型的后训练与强化学习研发,持续提升机器人任务成功率、稳定性与泛化能力。
- 研究如何利用机器人真实执行中的成功、失败、人工干预及环境反馈进行持续学习。
- 构建高效、稳定、可扩展的 Offline / Online RL 与真机后训练体系。
- 探索机器人经验的数据配方与 Scaling Law,研究交互规模与模型能力增长之间的关系。
- 推动大规模真实机器人训练—执行—反馈—再训练闭环。
【任职要求】
- 硕士及以上学历,计算机、机器人、自动化、人工智能等相关方向,具备扎实的强化学习 / 深度学习基础和良好的代码能力。
- 熟悉强化学习、模仿学习或机器人学习,对 Offline / Online RL 等方向有较深入理解。
- 有 VLA 后训练、真机强化学习、大规模 RL 或多模态模型后训练经验者优先。
- 具备较强的实验能力,能够独立推进算法设计、训……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。