进入工作台 →

蚂蚁集团-大模型强化学习算法专家-阿福

🏢 蚂蚁集团📍 北京/杭州
🎓 硕士 🧭 1年以上 🎯 社招 发布于 2026-08-27 来源:蚂蚁集团招聘
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

1. 负责医疗基础模型的大规模强化学习算法研发、训练,通过RL scaling 提升医疗基模在复杂医疗诊断、循证、分析等场景的能力。 2. 设计RL算法和奖励机制、提升学习效率、训练稳定性, 通过长周期、高效的学习,提升模型在复杂问题场景的推理能力。 3. 通过与Infra团队co-design, 研发和扩展agentic RL环境,通过提升交互与反馈的质量和规模实现agentic能力的泛化。 【任职要求】 1. 硕士及以上学历,计算机科学或相关专业背景 2. 有大模型强化学习相关的研究经历,具备丰富的训练经验,深入理解PPO/GRPO/IcePop等主流强化学习算法 3. 具备扎实的算法工程实现能力,熟悉Python编程语言和PyTorch深度学习框架,有开源框架Areal/verl/slime/openrlhf使用经验 4. 熟悉AI coding,对常用工具如claude code…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 求职者营地 · 岗位数据受版权与反爬保护,禁止抓取与镜像