岗位描述(节选)
【岗位职责】
"1、运维架构整体设计:负责大规模GPU集群、IB/RoCE高速网络、分布式存储、调度资源的运维架构规划与迭代,设计高可用运维架构、故障域隔离、容量架构、扩容演进方案,支撑超大规模AI算力集群的持续规模化扩张。
2、运维体系标准化建设:搭建完整的智算集群运维SOP、变更体系、故障治理体系、值班体系、容灾预案,统一运维规范、基线标准、版本标准、巡检标准,实现运维工作体系化、可复制、可规模化。
3、运营系统架构设计:对接内部云管平台、Infra加速团队,设计算力运营、监控观测、资源管理、SLA履约、资产健康管理整体架构,定义数据口径、指标体系、告警体系、可视化大盘架构。
4、集群可运维性优化:针对GPU异构集群、IB/RoCE网络、多机通信、训练任务场景,优化集群可观测性、故障自愈、故障快速定位能力,降低运维压力,提升集群整体可用率与算力利用率。
5、重大技术风险治理:主导P0/……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。