🚀 求职者营地
进入工作台 →
混元多模态强化学习(RL)算法研究员(北京/上海)
🏢 腾讯
📍 深圳
🧭 两年以上工作经验
🎯 社招
发布于 2026-09-16
来源:腾讯招聘
登录查看完整 JD、匹配评分与一岗一历
岗位描述(节选)
1.针对多模态模型开展强化学习算法研究,包括面向图像、视频生成的扩散模型,面向多模态理解的自回归模型,以及前沿统一多模态框架; 2.设计并开发强化学习训练框架与奖励建模策略,实现高效的大规模训练,提升训练稳定性,并解决奖励作弊等相关问题; 3.探索下一代强化学习范式,使其能更直接、更高效地从环境反馈中学习。
© 2026 求职者营地 · 岗位数据受版权与反爬保护,禁止抓取与镜像