岗位描述(节选)
1、深度参与多模态/大语言模型训练全链路开发,包括数据、预训练、后训练全流程优化;
2、设计和优化分布式训练框架,通过混合并行,通信计算overlap、低精度训练等方法解决超长序列、超大规模moe场景下的训练效率问题;
3、参与通用高性能RL框架的开发和优化;
4、算法工程co-design,探索最优的训练范式。
【任职要求】
1、熟悉C++/Python编程,有较好的编程风格和代码管理能力;
2、有优秀的逻辑分析能力,能够对业务逻辑进行合理的抽象和拆分;
3、有大模型算法领域知识者优先;
4、有开源分布式训练框架,PyTorch/Megatron/Verl等经验优先;
5、有设计和优化大语言模型预训练、微调、强化学习流程经验者优先;
6、有大模型训练基础设施相关从业经验者优先。