岗位描述(节选)
1. 多地域AI集群的 K8s 平台搭建、调优(apiserver / etcd / scheduler / kubelet等核心组件)、版本升级、参数变更与日常巡检
2. 自研训推平台系统的部署、发布与变更
3. 集群节点上下线流程管理、与硬件运维协同处理故障节点
4. 集群故障定位与恢复:包括控制面降级、apiserver 性能异常、etcd OOM、节点批量 NotReady、慢节点、网络异常等典型场景
5. 集群与服务器安全加固(CIS 基线、kubelet 参数、network policy 落地)、堡垒机联动、运维审计
6. 故障应急 Runbook 与 SOP 文档编写,主导或参与故障复盘
【任职要求】
- 计算机科学与技术、软件工程、信息系统等计算机相关专业,本科及以上学历
- 4 年以上大规模 K8s 集群运维经验
- 精通 K8s 核心组件(apiserver / e……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。