岗位描述(节选)
1.负责智算集群的日常运维与稳定性保障,覆盖服务器硬件的监控、巡检、故障诊断与维修更换,根据信息安全相关要求完成现场落地实施和安全防护;
2.建立并优化集群的可观测性体系(监控指标、日志采集、告警策略),实时跟踪GPU利用率、功耗、温度及互联带宽,提前发现并规避潜在风险;
3.负责大模型训练/推理环境的搭建与维护,确保分布式任务稳定运行,解决运行中的软硬件兼容性及性能瓶颈问题;
4.负责对已投产系统的架构优化和运行优化,对标集团/行业标准规范制定落地方案并组织实施;
5.制定并完善运维规范SOP/MOP、故障处理SOP、应急响应预案和硬件生命周期管理制度,定期输出运维报告与优化建议;
6.参与集群扩容、架构升级及新技术引入的评估与落地,从运维角度提出高可用、高可靠的设计方案;
7.承担复杂技术攻关任务。
【任职资格】
教育:硕士研究生及以上学历,计算机、电子、通信、软件、自动……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。