进入工作台 →

具身大模型强化学习工程师

🏢 银河通用
🎯 社招 发布于 2026-08-25 来源:大疆官网
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

职位描述 1. 负责具身智能大模型强化学习(RL)相关算法的研究与开发,探索强化学习在机器人操作、具身决策以及多模态大模型 post-training 中的应用; 2. 设计和优化面向具身智能的强化学习训练框架,包括但不限于 offline RL、online RL、batch online RL、residual RL、human-in-the-loop RL 等方法,提升模型在真实机器人任务中的性能、泛化能力和数据效率; 3. 研究和设计适用于具身大模型的 reward model、critic、task progress / failure signal 等训练与反馈机制,充分利用成功、失败、人工接管等多类型数据,提升策略学习效果并降低 reward hacking 等风险; 4. 探索大模型与强化学习相结合的训练范式,包括 LLM / VLM / VLA 等模型的 RL post-…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 职通车AI · 岗位数据受版权与反爬保护,禁止抓取与镜像