岗位描述(节选)
【岗位职责】
1.负责GPU集群日常运维:服务器、InfiniBand/RoCE网络、并行存储的部署、监控与故障处理,保障训练/推理业务连续性;
2.基于K8s/Volcano/Slurm落地算力调度策略(分时复用、优先级、配额),持续提升GPU利用率与集群效率;
3.负责大模型部署与推理服务运维(vLLM/Triton等),保障高并发下的稳定性与延迟表现;
4.建设智算平台监控可观测与AIOps能力(故障预测、自动巡检),推动运维自动化;
5.参与算力成本运营(FinOps)与国产算力(昇腾等)适配验证,沉淀运维SOP与知识库。
【任职要求】
1、本科及以上学历,计算机、通信、电子等相关专业;
2、3年以上云计算或AI基础设施运维经验,有GPU集群(百卡级及以上)实际运维调优经历;
3、熟悉Linux、Kubernetes、Python/Shell自动化,了解NVIDIA生态(CUDA……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。