岗位描述(节选)
1. 参与模型服务平台云原生管控系统的开发,包括服务生命周期管理、弹性伸缩、灰度发布等核心能力建设
2. 负责大规模GPU集群的资源管理与调度系统开发,包括资源分配、超卖策略、异构资源调度等
3. 参与基于Kubernetes的调度器与Operator开发,实现GPU资源的精细化调度与利用率优化
4. 负责大规模GPU集群的稳定性建设,包括故障检测与自愈、可观测体系、安全管控等
5. 参与平台产品化与计量计费系统的开发,支撑商业化运营
6. 根据用户反馈快速定位线上问题,将运维经验沉淀为平台能力,持续提升系统可靠性
【任职要求】
1. 计算机相关专业,具备golang开发经验,三年以上分布式系统相关工作经历,具备复杂系统软件的设计能力和调试能力
2. 精通Kubernetes架构与调度机制,有Scheduler/Controller开发经验,深入理解K8s资源模型与调度扩展
3. 熟悉G……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。