岗位描述(节选)
1.负责线上生产环境的稳定性保障,包括系统监控、故障应急、容量规划、性能调优与日常运维,持续提升服务可用性(SLA)。
2.设计并研发内部运维平台/工具(如自动化部署、监控告警、容量管理、成本优化、故障自愈等),用工程化手段替代重复性人工操作。
3.基于阿里云及 Kubernetes 构建和维护云原生基础设施,负责集群的部署、扩缩容、升级与治理。
4.建设并持续完善云上与业务两个维度的监控告警和日志收集体系:整合阿里云 SLS、Prometheus、Grafana 等能力,覆盖基础设施、云产品与业务指标,制定合理的告警策略与可观测大盘,实现问题的及时发现与快速定位。
5.推进 CI/CD 流水线建设,完善发布、回滚、灰度机制,保障变更安全高效。
6.参与线上重大故障的排查与复盘,沉淀应急预案与最佳实践,从根因上减少故障复发。
【任职要求】
1.本科及以上学历,计算机相关专业,3 年以上运……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。