岗位描述(节选)
构建面向大规模AI集群的GPU微架构采集、性能剖析与优化决策系统,建设集群的性能分析、瓶颈定位、故障诊断等核心能力。
1. 针对NVIDIA、AMD、国产GPGPU等多厂商芯片,设计并实现规模化、无侵入的kernel级采集工具链和微架构指标体系;
2. 构建AI continuous profiling系统,将GPU kernel数据与算子执行、框架调度、通信原语、CPU性能、高性能通信性能相关联,为全栈性能优化提供量化的性能瓶颈数据和画像系统;
3. 结合理论 Roofline 分析与 simulation 方法,融合线上 profiling 数据,建设集群范围的软硬件配合与关键性能瓶颈分析体系,支撑AI训练与推理典型负载下的系统级优化;
4. 跟踪主流GPU架构演进,参与AI基础设施规划与设计,结合生产应用画像,支撑多元GPU/AI ASIC芯片的适配与优化,构建异构硬件性能的全链路量……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。