岗位描述(节选)
1、稳定性治理体系:制定平台与业务两层的 SLO 目标与度量口径;建立容量水位、变更管控、灰度发布与稳定性度量机制;担任业务上线前稳定性评审的把关人,推动线上风险项的收敛闭环;
2、告警与 oncall:在已有监控能力之上建设分级告警体系,设计依赖抑制、聚合去重、静默与防风暴机制;建设告警路由与分发策略,把硬件与平台事件归因为业务可理解的影响面;建设 oncall 响应机制(排班、升级链路、处置留痕、故障演练),沉淀 SOP 与应急预案,并把复盘结论回流为告警规则与巡检项;
3、故障定位与根因分析:负责 P0/P1 故障的定位、根因分析与改进项跟踪,覆盖 GPU 硬件(掉卡、显存异常、降频)、网络互联(通信退化、拥塞)、存储与调度链路;
4、可观测能力的承接与演进:承接平台已建成的可观测底座,负责指标口径的统一定义与治理,实现一处定义、多处消费(大盘 / 告警 / 分析 / 计费);补齐推……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。