岗位描述(节选)
岗位定位
负责 LLM 推理服务全链路的稳定性,让模型、框架、Router、网关等每个环节都处于可控、可观测、可回滚、可恢复、可容灾的状态;通过持续容灾演练和自研工具/系统,持续提升推理系统的可靠性与运维效率。
职责
1. 负责推理服务的部署与发布稳定性:建立覆盖模型/框架/Router/网关的可观测、灰度、回滚、恢复机制,对推理服务的可用性与核心SLO(TTFT/TPOT/成功率)负责。
2. 建设和维护推理全链路监控体系:从推理、网络、Workload 三个维度建设黄金指标与看板,能从网关 → Router → Runtime → GPU/NCCL逐层下钻定位问题。
3. 承担 On-call,作为 P0/P1 故障 IC 主导定位、止血、恢复与复盘,持续压降 MTTR。
4. 制定并执行容灾演练计划:覆盖多 AZ/多集群故障转移、GPU/NCCL/网关/Router 等故障注入,……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。