岗位描述(节选)
【岗位职责】
1. 设计并建设AI基础设施平台,覆盖GPU算力调度、模型训练/推理服务、数据管道等核心能力
2. 基于云原生架构打造安全、高可用的运维底座,推动基础设施即代码与平台工程实践
3. 负责千台级服务器集群的运维与治理,构建弹性伸缩、故障隔离、容量管理能力
4. 建设AI安全防护与合规体系,保障模型、数据、算力全链路的安全性
5. 开发运维自动化工具与智能运维(AIOps)能力,提升故障发现与自愈效率
6. 参与AI业务架构设计,输出运维安全最佳实践并推动落地
【任职要求】
1. 本科及以上学历,5年以上运维开发/SRE经验,具备大规模生产环境运维经验
1. 精通云原生技术栈(Kubernetes、Docker、Helm、Operator模式等),熟悉AI基础设施(GPU集群、模型训练/推理平台、MLOps),具备千台以上服务器的运维经验
2. 精通Linux系统与网络协议,熟……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。