岗位描述(节选)
1. 负责理想汽车 AI 平台大规模 GPU 集群、RDMA 网络及并行高速存储的稳定运行与日常运维,保障训练、推理等核心 AI 业务高效交付。
2. 负责大规模 GPU 集群在训练任务、资源调度、网络通信、存储访问等场景下的故障定位与问题解决,持续提升平台稳定性和可用性。
3. 深入理解 AI 训练与推理业务场景,参与 AI 平台在 Kubernetes 多集群、监控告警、日志检索、故障诊断等方向的云原生架构演进与落地。
4. 建设和完善 AI 平台运维体系,包括稳定性治理、故障应急、容量管理、资源运营、SLA 保障等,提升平台规模化运维能力。
5. 推动运维自动化和智能化建设,开发自动化运维工具、巡检工具、故障自愈能力和运维 Agent,降低人工干预成本,提升问题发现与处理效率。
【任职要求】
1. 具备较强的问题分析和解决能力,能够在复杂系统环境下快速定位问题;具备良好……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。