岗位描述(节选)
"1. 负责智算中心 GPU 服务器集群的日常运维管理,包括服务器硬件巡检、故障定位与报修跟进,保障算力资源稳定可用;
2. 负责国产 GPU(真武、昆仑芯、沐曦等)服务器的驱动、固件、算力组件的部署与版本维护;
3. 负责大模型训练与推理环境的部署与调优,包括模型权重管理、推理服务(vLLM/TGI 等)部署、显存与算力资源分配;
4. 负责模型管理平台的日常运维,包括模型仓库管理、镜像构建、容器编排(Docker/Kubernetes)、服务发布与回滚;
5. 负责智算集群监控告警体系的维护,覆盖服务器硬件、GPU/NPU 状态、网络、存储及模型服务运行指标,及时响应并处理告警;
6. 配合开发与算法团队完成大模型训练/推理任务的环境搭建、资源调度与问题排查;
7. 编写运维自动化脚本与操作手册,沉淀运维知识库,持续提升运维效率。" "1. 本科及以上学历,计算机、软件工程、通信等相关……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。