进入工作台 →

蚂蚁集团-大语言模型强化学习算法专家-北京/上海/杭州【AGI专项】

🏢 蚂蚁集团📍 北京/上海/杭州
🎓 硕士 🧭 3年以上 🎯 社招 发布于 2026-09-07 来源:蚂蚁集团招聘
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

1. 负责研发大语言模型强化学习算法,提升大模型在强化学习阶段的训练效率,以及提升大模型在数学、代码等自然科学领域的推理能力 2. 负责研发奖励和评价模型,包括细粒度的过程监督和奖励建模,覆盖复杂推理、指令遵循等各种任务 3. 参与后训练和推理阶段的Scaling Law研究,包括奖励模型训练、强化学习训练、推理阶段的Scaling Law 【任职要求】 1. 硕士及以上学历,计算机科学或相关专业背景 2. 有大模型相关的研究经历,在post-training方向具备一定的训练经验,熟悉奖励模型建模,PPO/REINFORCE/RLOO等主流强化学习算法 3. 具备扎实的算法工程实现能力,熟悉Python编程语言和PyTorch深度学习框架,熟悉DeepSpeed/Megatron等主流分布式训练框架 4. 具备良好的分析和问题解决能力、优秀的工程素养,能够独立思考和解决实际问题 5. …… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 求职者营地 · 岗位数据受版权与反爬保护,禁止抓取与镜像