岗位描述(节选)
1. 负责医疗基础模型的大规模强化学习算法研发、训练,通过RL scaling 提升医疗基模在复杂医疗诊断、循证、分析等场景的能力。
2. 设计RL算法和奖励机制、提升学习效率、训练稳定性, 通过长周期、高效的学习,提升模型在复杂问题场景的推理能力。
3. 通过与Infra团队co-design, 研发和扩展agentic RL环境,通过提升交互与反馈的质量和规模实现agentic能力的泛化。
【任职要求】
1. 硕士及以上学历,计算机科学或相关专业背景
2. 有大模型强化学习相关的研究经历,具备丰富的训练经验,深入理解PPO/GRPO/IcePop等主流强化学习算法
3. 具备扎实的算法工程实现能力,熟悉Python编程语言和PyTorch深度学习框架,有开源框架Areal/verl/slime/openrlhf使用经验
4. 熟悉AI coding,对常用工具如claude code……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。