进入工作台 →

GPU 集群 SRE 工程师(稳定性治理)

🏢 米哈游📍 上海
🎯 社招 来源:米哈游招聘
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

1、稳定性治理体系:制定平台与业务两层的 SLO 目标与度量口径;建立容量水位、变更管控、灰度发布与稳定性度量机制;担任业务上线前稳定性评审的把关人,推动线上风险项的收敛闭环; 2、告警与 oncall:在已有监控能力之上建设分级告警体系,设计依赖抑制、聚合去重、静默与防风暴机制;建设告警路由与分发策略,把硬件与平台事件归因为业务可理解的影响面;建设 oncall 响应机制(排班、升级链路、处置留痕、故障演练),沉淀 SOP 与应急预案,并把复盘结论回流为告警规则与巡检项; 3、故障定位与根因分析:负责 P0/P1 故障的定位、根因分析与改进项跟踪,覆盖 GPU 硬件(掉卡、显存异常、降频)、网络互联(通信退化、拥塞)、存储与调度链路; 4、可观测能力的承接与演进:承接平台已建成的可观测底座,负责指标口径的统一定义与治理,实现一处定义、多处消费(大盘 / 告警 / 分析 / 计费);补齐推…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 求职者营地 · 岗位数据受版权与反爬保护,禁止抓取与镜像