岗位描述(节选)
1、负责大规模分布式训练框架的设计、开发与优化,覆盖预训练和后训练全流程,支撑千卡/万卡级别集群的高效训练
2、优化训练性能,包括并行策略(数据并行、张量并行、流水线并行、专家并行)、通信优化、显存管理与计算重叠,针对特定模型挖掘芯片的极致性能
3、排查并解决训练过程中的性能瓶颈和稳定性问题,联合训练平台保障超大集群任务训练稳定性
4、与算法团队紧密协作,针对新模型结构提供框架层面的支持与适配
5、跟进业界前沿技术,推动训练框架在效率、成本、稳定性上的持续演进
【任职要求】
1、计算机、软件工程或相关专业本科及以上学历
2、扎实的编程能力
3、熟悉流深度学习框架及其分布式训练机制
4、深入理解分布式训练原理,熟悉 Megatron-LM、DeepSpeed、FSDP等主流框架中至少一种的实现细节
5、熟悉 GPU 体系结构与 CUDA 编程或者其他国产加速芯片和配套软件栈(昇腾NPU、海……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。