岗位描述(节选)
1、负责大模型推理平台的设计与建设,支撑多模型、多租户、多业务场景下的推理服务部署、资源调度、弹性伸缩、灰度发布、故障自愈和稳定性治理。
2、负责推理工作负载的平台化抽象与工程落地,建设面向分布式推理、多副本推理和多角色协同服务的生命周期管理能力,提升推理服务的部署效率、运维效率和稳定性。
3、负责异构算力资源管理、多集群调度和服务性能优化能力建设,持续提升大规模推理场景下的资源利用率、模型加载效率、服务启动速度、可观测能力和整体交付效率。
【任职要求】
1、本科及以上学历,计算机、软件工程、人工智能、分布式系统、云计算等相关专业优先。
2、熟练掌握 Go / Python / Rust 中至少一种语言,具备良好的工程实现、系统设计和问题排查能力。
3、熟悉 Kubernetes / Docker / Helm 等云原生技术,理解 Deployment、StatefulSet、Servi……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。