岗位描述(节选)
【岗位职责】
1、负责Hadoop大数据集群
2、负责AI软件及算力集群运维,包含GPU训练集群、推理环境部署维护,适配TensorFlow、PyTorch等主流AI框架,处理模型训练中断、环境依赖冲突、算力调度异常、推理服务故障等问题。
3、熟练使用AI工具辅助运维&运维开发,依托大模型完成运维脚本编写、优化、迭代(Shell/Python),实现集群自动化巡检、日志分析、故障筛查、资源清理等自动化能力落地。
4、搭建及维护监控告警体系(Prometheus、Grafana、ELK),梳理运维知识库、标准化故障处理流程,持续优化集群稳定性、提升资源利用率。
5、负责线上大数据、AI业务日常保障、应急响应、问题复盘,持续通过AI赋能优化运维流程,降低人工运维成本、缩短故障处理时长。
【任职要求】
1、3年以上大数据运维、AI运维相关工作经验,必须具备Hadoop集群完整运维经验,熟悉大数……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。