岗位描述(节选)
1. 结合业务发展规划(训练/推理),负责AI算力系统(GPU/CPU/网络设备/存储等)的选型评估与技术路线规划;跟踪行业前沿硬件动态,为AI硬件引入决策提供技术输入;
2. 负责算力系统引入的前置评估与验收,制定并执行硬件验收测试方案,覆盖性能基准、压力稳定性、RAS特性、多机训练/推理单集群多品牌机器混部场景测试,识别潜在风险点并推动问题闭环;
3. 负责AI异构硬件系统OS交付流程的全链路管理,保障BIOS、BMC,CPLD,NIC FW,GPU FW bundle 版本等关键软件栈组件的版本把控和可追溯性;
4. 线上稳定性保障,建立硬件全生命周期监控体系,保障大规模集群上线后的持续稳定运行,参与容量规划、故障预案制定等基础设施保障工作,深入GPU固件、驱动、运行时等多个层面进行问题定位,建立标准化的故障诊断流程(SOP),提升问题定位效率与故障闭环效率;
5. 支撑AI相关业务……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。