岗位描述(节选)
1. 主导万卡集群大模型训练与推理系统架构设计,保障主流框架高效稳定运行;
2. 基于CUDA、Triton等语言优化底层算子性能,提升集群资源利用率与任务吞吐量;
3. 建立系统性诊断机制,定位分布式训练中的通信与计算瓶颈,制定可验证优化方案;
4. 组织团队总结高性能计算最佳实践,形成可复用技术方案并推动落地实施;
5. 带领技术团队完成基础设施攻关,培养工程师在AI Infra领域的架构设计与优化能力。
【任职要求】
1. 具备万卡规模下大模型训练与推理系统架构设计能力,保障主流框架高效稳定运行;
2. 掌握基于CUDA、Triton等语言的底层算子性能调优技术,提升集群资源利用率与任务吞吐量;
3. 能够从分布式训练异常中定位通信或计算瓶颈,并制定可验证的优化方案;
4. 具备开阔技术视野与前瞻判断力,敢于在高复杂度场景下做出架构决策;
5. 符合京东价值观:客户为先、创新、拼搏……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。