岗位描述(节选)
岗位职责
1、负责牵头AIOPS项目的研发以及落地,如故障根因分析,变更风险预测等;
2、负责监控工具以及平台的运维,包括但不限于zabbix, ELK,prometheus, dynatrace, skywalking;
3、负责告警能力的完善,如告警降噪,告警分派,多源告警接入等;
4、负责和业务方对接监控告警需求,不断推动业务监控覆盖,提升全局业务可观测,降低故障MTTR;
任职要求
1、988,211院校全日制统招本科及以上学历,计算机、网络工程、软件工程、信息安全等相关专业优先;
2、3年及以上互联网SRE/高级运维/稳定性相关工作经验,有中大型业务集群、线上高并发业务稳定性保障经验;有峰值压测、重大故障治理、可观测体系搭建实战经验者优先;
3、精通Linux内核参数调优、系统性能排查,熟练定位CPU、内存、磁盘IO、网络丢包、连接溢出、时延抖动等深层次问题;精通TCP/IP、H……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。