岗位描述(节选)
1. 负责超大规模大数据平台及 AI平台的稳定性保障,围绕监控告警、故障诊断、容量水位、链路治理、变更风险、应急处置和复盘改进等场景,持续提升系统可靠性。
2. 负责生产环境部署、发布、扩缩容、迁移等关键场景的稳定性保障,沉淀交付与运营的标准化方案。
3. 负责支持客户业务平稳迁移方案设计、适配、风险评估,在迁移关键节点提供稳定性兜底。
4. 参与智能运维 Agent建设,结合大模型、RAG、工具调用、自动化编排和知识库能力,落地日志分
析、指标分析、故障归因、异常检测、根因定位、SOP 执行和运维问答等AI化运维能力。
【任职要求】
1. 深入理解 ElasticSearch、EMR、Spark、StarRocks 等分布式系统技术架构和调用链路,熟悉阿里云云原生架构与网络架构。
2. 3 年以上云计算/AI相关工作经验,具备某一大产品领域知识(基础设施,网络,云原生)+AI领域知识,……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。