岗位描述(节选)
面向大模型在线服务系统,负责线上实时性能观测、端到端分析与优化,推动问题从业务指标定位到推理引擎和 GPU Kernel。
岗位职责如下:
1.建设面向生产环境的实时可观测与诊断能力,持续采集并关联 Metrics、Logs、Trace,在异常发生时按需触发 Profile;结合 OpenTelemetry、Nsight Systems/Compute、CUPTI 等工具,在线发现并定位计算、显存带宽、通信、调度、KV Cache 与排队瓶颈,下钻到代码路径或 GPU Kernel。
2.分析大模型模型服务系统的端到端性能,围绕 TTFT、TPOT、Throughput、Goodput、MFU/MBU 和资源成本,建立从业务请求、在线服务、推理引擎到 GPU 的分层指标体系。
3.协同引擎团队,推动性能优化,覆盖 Prefill/Decode、Continuous Batching、Sch……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。