岗位描述(节选)
职位定位:
人工智能与人形机器人研究院强化学习方向负责人,负责突破复杂决策场景下的算法瓶颈,推动强化学习(RL)在工业领域的技术落地,构建具备自我进化能力的智能系统,赋能全链条业务场景。
岗位职责:
算法创新与智能决策
设计面向复杂工业环境的强化学习算法,解决样本效率低、探索-利用权衡、稀疏奖励、多目标优化等关键问题;
探索基于模型(Model-based RL)、分层强化学习(HRL)、元强化学习(Meta-RL)、逆强化学习(JRL)等前沿方向的技术融合与改进。
结合大规模技术,研究语言驱动器化学习(Language-guided RL)、世界模型(World Models)等跨模态决策框架。
大规模强化学习系统构建
构建分布式强化学习训练框架,优化并行采样、离线强化学习(Offline RL)与在线学习的混合训练机制。
开发高效仿真环境与智能体交互接口,支持高保真物理模拟、多智能体协……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。