岗位描述(节选)
1.推理服务全链路稳定性:负责 MaaS 推理服务(网关/调度/协议适配/引擎)的可用性与性能,主导 SLA 定义与达成,落地容量水位管理与反压(限流/熔断/优先级调度)机制,保障高并发下服务稳定;
2.推理性能与效率深度优化:定位并优化 TTFT/TPOT/吞吐/首包时延等核心指标瓶颈,深入推理引擎(vLLM/SGLang/TensorRT-LLM 等)的批调度、KV Cache、量化与并行策略,联合研发持续提升单卡与单节点产出;
3.多站点与容灾架构:设计并落地多可用区 / 多站点条带化部署架构与切流方案,主导故障演练与 AZ 级切换,消除跨 AZ 带宽与单点风险;
4.成本与容量运营:建立推理服务的容量量化模型(TPM / 水位 / 单副本承载力),基于真实压测数据做资源规划与成本优化,提升 GPU 资源整体利用率;
5.运维自动化与智能化:建设推理服务的可观测体系(指标 / 链路追……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。