岗位描述(节选)
1、负责可灵AI大规模AIGC服务及在线推理系统的可靠、稳定、高效运行;
2、负责可灵AI多模态生成模型(视频/图像/3D)的推理服务高可用保障,确保生成链路端到端稳定交付;
3、负责可灵AI异构算力集群的稳定性保障,推进GPU资源池化、弹性扩缩容及运维自动化工具链建设;
4、负责可灵AI相关算力资源的管理与规划,包括预算成本管控、推理资源效率优化、多模型混部与统一调度等。
【任职要求】
1、本科及以上学历,计算机、软件工程相关专业,具备互联网业务运维经验;
2、有大型分布式系统的运维和资源管理经验,有 K8S 和 GPU 集群运维经验优先;
3、具备扎实的计算机软件开发基础知识,精通 Linux 操作系统、网络、存储等相关原理;
4、熟悉一种或多种编程语言,包括但不限于 Shell/Python/Golang/Java/C 等;
5、具备较强的问题分析解决能力,有强烈的责任心……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。