岗位描述(节选)
负责司内AI平台和AI算力的日常运维、故障处理、资源管理和稳定性保障工作。
负责AI相关配套资源的运维和管理支持工作,与供应商对接问题,保证资源服务可用性。
建设算力/存储/网络/CPU 的 SLO 追踪与告警监控,推动利用率提升与低效治理。
参与SRE运维平台建设,集成多集群的服务监控、资源管理、可观测等能力和定制化需求开发。
保障 Dots 大模型推理服务高可用,覆盖部署、升级、发布准出、容灾演练全流程。
【任职要求】
本科及以上,计算机相关专业,5 年左右 SRE / 运维 / 基础设施研发经验;
精通 Linux / Kubernetes/网络等基本知识,熟悉主流云厂商云服务与控制台操作
熟悉至少一种以上开发语言(Python/Shell/Go),具备独立开发运维平台或自动化工具的能力;
熟悉 GPU 基础知识(型号、算力、显存、GPU 网络),有故障发现和排障能力;
对大模型推……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。