岗位描述(节选)
1. GPU 服务器的故障诊断、故障恢复、报修跟进与 RMA 流程对接
2. 机器上架压测与集群初始交付性能压测(NCCL allreduce、HBM、网卡、磁盘等基线)
3. 服务器固件与驱动批量变更(BIOS、BMC、网卡固件、GPU 驱动、Fabric Manager)的灰度发布与回滚
4. 厂商工具链(DCGM、Nsight、Fabric Manager 工具等)调研与平台集成
5. 异构 AI 加速卡的硬件层适配,包括 device plugin 接入、健康检测、固件管理
6. BMC / BIOS 参数调优
7. 与驻场团队、GPU 及 OEM 厂商的工单对接
【任职要求】
- 计算机科学与技术、电子工程、通信工程等计算机相关专业,本科及以上学历
- 3 年以上 GPU 服务器运维经验
- 熟悉主流 GPU 体系(NVLink / NVSwitch / Fabric Mana……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。