岗位描述(节选)
岗位职责:
1、负责AI服务器集群、GPU服务器、存储及网络设备的日常巡检、监控、故障排查和应急处理,保障集群稳定运行。
2、负责服务器上架、下架、布线、BMC配置、操作系统及驱动维护,并协助处理GPU、硬盘、内存、网卡等硬件故障及售后维修。
3、负责集群资源、设备状态、容量和故障情况的统计分析,完善监控、告警、巡检和运维文档。
4、负责服务器、GPU、网卡、硬盘、内存、线缆及备件等高价值硬件资产的入库、出库、调拨、借用、盘点和台账维护。
5、建立并维护设备序列号、机柜位置、配置信息、保修状态及备件库存等资产信息,确保账实一致。
6、协调供应商、机房及内部使用团队,跟进设备采购、到货验收、维修、更换和报废等事项。
任职要求:
1、计算机、网络、通信、电子信息等相关专业本科及以上学历。
2、具备2年及以上服务器、数据中心、集群或网络运维经验,有GPU/AI算力集群运维经验者优先。
3、熟悉L……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。