岗位描述(节选)
【岗位职责】
· 负责AI云平台核心模块的设计与开发,包括GPU集群调度、资源管理、任务编排等
· 构建高性能分布式存储与数据加速方案,优化大模型训练与推理的数据供给链路
· 设计并实现RDMA/RoCE等高性能网络方案,降低分布式训练通信开销
· 开发集群监控、告警与运维自动化体系,保障大规模GPU集群的稳定运行
· 参与云原生组件的定制化开发与优化,适配AI工作负载的特殊需求
【任职要求】
· 本科及以上学历,计算机、信息、电子等相关专业,1年以上相关经验
· 精通Go或C++,具备扎实的系统级编程能力与分布式系统开发经验
· 深入理解Kubernetes架构与调度机制,有Operator/CRD开发经验
· 熟悉GPU计算生态(CUDA/NVML/MIG等)及异构资源管理
加分项(非必需)
· 有大规模GPU集群(千卡级以上)调度与运维实战经验
· 熟悉NCCL/RDMA等高性能……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。