岗位描述(节选)
职位描述
1. 负责具身智能大模型强化学习(RL)相关算法的研究与开发,探索强化学习在机器人操作、具身决策以及多模态大模型 post-training 中的应用;
2. 设计和优化面向具身智能的强化学习训练框架,包括但不限于 offline RL、online RL、batch online RL、residual RL、human-in-the-loop RL 等方法,提升模型在真实机器人任务中的性能、泛化能力和数据效率;
3. 研究和设计适用于具身大模型的 reward model、critic、task progress / failure signal 等训练与反馈机制,充分利用成功、失败、人工接管等多类型数据,提升策略学习效果并降低 reward hacking 等风险;
4. 探索大模型与强化学习相结合的训练范式,包括 LLM / VLM / VLA 等模型的 RL post-……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。