岗位描述(节选)
1. 负责机器学习平台的资源调度系统设计与优化,提升集群资源利用率。
2. 构建和维护大规模算力集群,支撑大规模分布式训练、推理等多样化 AI 工作负载,保障高可用与高性能运行。
3. 与算法和工程团队协作,优化训练任务调度策略,针对 GPU 计算、显存、互联带宽等关键路径进行性能调优,降低训练成本与时间。
4. 建设覆盖硬件、驱动、调度链路的全栈可观测体系,基于监控数据驱动资源优化与容量预测决策。
5. 开发自动化运维工具,实现任务调度、监控告警与故障自愈能力。
6. 跟踪业界前沿技术,持续改进集群管理与调度架构。
【任职要求】
1. 计算机基础扎实,熟练掌握Go、Python或Java至少一种编程语言。
2. 3年以上软件开发或系统架构经验,有大规模集群管理经验者优先。
3. 熟悉Kubernetes、Containerd、Docker等云原生核心技术栈和云原……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。