岗位描述(节选)
1.负责多模态生成、LLM 等核心模型的万卡级训练编排与调度系统建设,包括任务生命周期管理、资源调度、拓扑感知及排队策略优化;
2.建设训练稳定性与容错能力,覆盖软硬件异常检测、故障定位、自动恢复和断点续训;
3.完善训练可观测与效率分析体系,识别计算、通信、存储及资源调度等环节的性能瓶颈,推动资源利用率和训练效率极致优化;
4.参与核心模型在国产异构卡上的训练适配与效率调优工作。
【任职要求】
1. 计算机相关专业本科及以上学历,熟练掌握 Golang/Python,具备良好的算法、数据结构及工程能力,熟悉分布式系统基本原理,有高性能系统研发经验者优先;
2. 自驱、务实,对系统底层问题有钻研热情,具备复杂问题分析与排查能力,探索简洁高效的优化办法并推进落地解决;
3. 了解并行计算、GPU 架构、网络通信、系统优化、集群架构等 HPC 相关的知识;有Megatron-LM/DeepS……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。