岗位描述(节选)
1.从推理框架与算子层的视角,参与异构资源 Profiling & Tracing 平台的架构设计与能力建设,覆盖框架调度、算子执行、硬件微观指标等全链路性能诊断能力;
2.能基于主流推理框架(vLLM / SGLang / TRT-LLM)的源码理解,分析调度策略对推理延迟与吞吐的影响,定位性能瓶颈并提出优化方案;
3.负责 GPU 满载运行场景下的稳定性与性能问题排查,包括 RAS 故障(ECC、XID、NCCL 超时)、框架层显存泄漏与 OOM 分析、推理延迟异常等;
4.负责从集群视角优化多卡/多节点的资源利用率与负载均衡;
5.负责建立面向多种异构硬件架构的统一诊断与 Profiling 能力;
【任职要求】
1.具备 5 年以上 AI Infra 相关工作经验,计算机相关专业背景;
2.拥有扎实的编码功底,精通python/C/C++/Go/Rust等语言,拥有规范的工程化能……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。