岗位描述(节选)
1. 参与美团超大规模的多模态大模型训练Infra建设
2. 负责美团大规模多模态基座模型训练框架架构迭代,稳定性、易用性、可运维能力和可观测能力建设
3. 负责高达数万卡规模和数万亿参数的大规模训练性能优化
【任职要求】
1. 有扎实的计算机理论基础,熟练掌握C++或Python语言
2. 熟悉CUDA或NPU编程经验优先,有RDMA实践经验优先
3. 深入了解PyTorch 或 TensorFlow等引擎的架构和运行原理,有深度定制经验优先
4. 有Megatron-LM、DeepSpeed 等大模型训练框架的优化经验优先
5. 深入理解大模型训练多维并行并行架构,如Tensor 并行、流水线并行、序列并行等
6. 深入理解多模态 模型结构,如ViT、DiT等
7. 学习能力和好奇心强,具备良好的沟通协调能力与团队协作精神