岗位描述(节选)
职位核心目标
负责超大规模分布式集群的稳定性治理与效能提升。通过深度参与底层架构优化、运维平台研发及 AIOps 技术落地,构建具备自愈能力、高可靠性及成本优势的大数据基础设施体系。
核心职责
1. 稳定性与架构治理:负责 Hadoop 生态(HDFS、YARN、Spark、Flink 等)及知名大数据厂商大数据生态的核心组件维护。针对高并发、多租户场景进行参数调优、内核优化及故障根因分析,保障 SLA 达成。
2. 运维平台化研发:深度参与自动化运维体系建设,涵盖资源调度、作业监控、全链路追踪及自助化运维平台。能够将运维逻辑抽象为成熟的平台产品,降低人工干预成本。
3. 智能化运维(AIOps)落地:探索并实践“AI + 运维”场景,包括但不限于基于大模型(LLM)的智能诊断 Agent、日志自动聚类分析、资源画像及基于历史数据的预测性调度等等。
4.……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。