岗位描述(节选)
1. 深入优化大模型端到端训练链路,系统分析计算、通信、内存、数据供给与集群运行效率,解决大规模训练中的性能瓶颈,提升算力利用率与训练迭代速度。
2. 参与不同计算硬件的训练框架适配与性能优化,推动模型、框架、通信和硬件之间的协同设计。
3. 跟踪分布式训练与高性能计算领域的前沿技术,推动性能优化方案从原型验证走向生产落地,形成可复用的技术方案、内部工具与工程实践沉淀。
【任职要求】
1. 硕士及以上学历,计算机、人工智能、数学等相关专业,3年以上工作经验
2. 具有生产级大模型训练系统研发经验,有deepspeed,Megatron等使用经验,实际解决过训练吞吐、规模扩展、Loss异常、任务长尾、节点故障、OOM或断点恢复等问题。
3. 具备良好的技术判断和跨团队推动能力,能够与算法、模型、集群、硬件等团队协作,推动复杂系统问题形成闭环。