岗位描述(节选)
1、GPU 核心能力建设:持续探索前沿 GPU 芯片的技术特性,包括国产卡适配、混合精度、模型量化、显存优化等技术,将芯片能力转化为业务竞争力,有力支撑集团 AI 战略落地;
2、万卡集群调度与管理:基于 Kubernetes 建设和运营万卡级 GPU 集群,负责 GPU 适配、拓扑感知调度、Gang 调度、GPU 故障自愈、全链路可观测等核心能力,支撑小米自研大模型 MiMo 的训练和推理等重点业务场景;
3、GPU 池化和利用率提升:统一纳管小米 GPU 资源,推进 GPU 调度优化、资源池化、GPU 虚拟化、训推混部等关键技术研发,持续提升全集团 GPU 资源利用率,实现技术降本增效。
1、熟悉主流 GPU 训练和推理芯片,熟悉 CUDA 生态,有大模型训练和推理优化经验优先;
2、熟悉 Kubernetes 和 GPU 算力管理,有万卡集群建设和 GPU 利用率提升经验优先;
3……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。