岗位描述(节选)
1. 负责大模型训练平台的架构设计与研发,支撑千卡/万卡级别的分布式训练任务调度与资源管理
2. 基于 Kubernetes 构建和优化云原生 AI 基础设施,包括自定义 Operator/CRD 开发,实现训练任务的自动化编排、弹性伸缩与故障自愈
3. 负责 GPU 资源池化、调度优化(如 Gang Scheduling、拓扑感知调度),提升集群整体利用率
4. 建设训练平台的可观测性体系(监控、日志、Trace),快速定位训练任务中的性能瓶颈与硬件故障
5. 与算法团队紧密协作,优化训练框架(PyTorch/Megatron/DeepSpeed等)与平台的集成效率,保障大规模训练任务的稳定性与吞吐
6. 参与多云/混合云环境下的 K8s 集群管理与统一调度能力建设
7. 推动平台工程效能提升,包括镜像构建加速、Checkpoint 管理、故障节点自动隔离与替换等机制
【任职要求】
1……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。