岗位描述(节选)
1.负责AIDC智算中心云和算力设备(GPU/NPU服务器、存储、网络设备)的日常运维与监控,保障万卡规模算力集群7×24小时稳定运行;
2.开展算力设备故障排查与应急处置,完成故障根因分析并输出事件报告,持续提升系统可靠性;
3.负责客户售后服务响应,及时处理客户工单与需求,保障客户满意度;
4.为客户提供L2、L3级高阶技术支持,包括疑难问题定位、性能分析及优化方案输出;
5.参与算力设备上架调试、系统部署、性能测试及验收交付工作;
6.负责算力运维标准体系建设,编制和完善EOP/SOP/MOP标准化运维规程,建设运维知识库;
7.开展算力运维能力构建,包括自动化运维工具开发、监控告警体系优化、运维数据统计分析;
8.探索AI智能体在算力运维场景中的应用,利用智能体辅助日常巡检、故障诊断、自动化处置等运维工作;
9.参与算力设备选型评估、技术方案制定及可运维性评审;
……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。