进入工作台 →

AI平台运维(AI Infra)

🏢 德赛西威📍 惠州
🎓 本科及以上 🎯 社招 来源:中科创达招聘
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

【岗位职责】 1.负责GPU集群日常运维:服务器、InfiniBand/RoCE网络、并行存储的部署、监控与故障处理,保障训练/推理业务连续性; 2.基于K8s/Volcano/Slurm落地算力调度策略(分时复用、优先级、配额),持续提升GPU利用率与集群效率; 3.负责大模型部署与推理服务运维(vLLM/Triton等),保障高并发下的稳定性与延迟表现; 4.建设智算平台监控可观测与AIOps能力(故障预测、自动巡检),推动运维自动化; 5.参与算力成本运营(FinOps)与国产算力(昇腾等)适配验证,沉淀运维SOP与知识库。 【任职要求】 1、本科及以上学历,计算机、通信、电子等相关专业; 2、3年以上云计算或AI基础设施运维经验,有GPU集群(百卡级及以上)实际运维调优经历; 3、熟悉Linux、Kubernetes、Python/Shell自动化,了解NVIDIA生态(CUDA…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 求职者营地 · 岗位数据受版权与反爬保护,禁止抓取与镜像