岗位描述(节选)
1. 负责大规模K8S集群的稳定性与生命周期管理,包括集群架构治理、版本升级、组件维护、参数变更、容量规划及日常巡检;
2. 负责K8S集群资源治理与成本优化,建设资源使用率、资源浪费、集群容量等可观测体系,持续优化资源配额、节点利用率及弹性扩缩能力;
3. 负责K8S集群及节点安全治理,包括 CIS Benchmark、节点及 kubelet 安全基线、NetworkPolicy、访问控制、堡垒机联动及运维审计等;
4. 建设集群监控告警、日志、链路追踪及故障自愈体系,负责故障应急 Runbook、SOP 文档编写,主导故障演练;
5. 推动容器化、自动化运维及云原生技术在业务中的落地,持续提升平台标准化、自动化和交付效率。
【任职要求】
1. 本科及以上学历,3年以上大规模 K8S 集群运维经验;
2. 熟悉至少一种主流公有云/私有云,包括但不限于Aliyun/腾讯云/AWS/GCP……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。