进入工作台 →

具身后训练/强化学习算法工程师

🏢 均普智能📍 上海招聘
🎯 社招 来源:企业官网(Moka多租户)
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

岗位职责: 1.负责具身策略模型的后训练方法研究与工程实现,覆盖 SFT、模仿学习、行为克隆、DAgger、离线强化学习、在线强化学习、RLFT、偏好优化和奖励建模等方向。 2.面向机器人操作任务设计策略优化方案,包括抓取、放置、推拉、插拔、开关门/抽屉、上下料、多步骤操作和长程任务等场景。 3.研究基础策略模型到具体任务技能的适配路径,探索如何通过任务数据、失败样本、奖励信号、评测反馈和在线交互提升模型表现。 4.负责机器人策略学习中的数据使用策略,包括轨迹筛选、成功/失败样本分析、正负样本构造、hard case mining、数据重加权、数据混合和课程学习。 5.设计奖励函数与奖励建模机制,包括任务完成奖励、过程奖励、安全约束、接触质量、动作平滑性、轨迹效率、碰撞惩罚和人为偏好反馈等。 6.研究离线到在线的策略迭代方法,探索如何在离线数据预训练基础上,通过仿真交互、真机小规模试验或评…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。

上海技术研发岗位行情

本站当前在招 1103 个上海技术研发岗位,其中 96 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 12K ~ 26K(25~75 分位),中位约 20K,最低 6K、最高 70K。
在招岗位较多的企业:米哈游 156 个拼多多 147 个阿里巴巴集团(含高德/阿里云) 122 个联影医疗 73 个理想汽车 57 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。

上海 其他在招岗位

按城市浏览招聘

© 2026 求职者营地 · 岗位数据受版权与反爬保护,禁止抓取与镜像