岗位描述(节选)
1、技术规划与架构设计:结合智算、云原生数据库及AI Agent业务需求,参与制定高可用的异构资源调度架构规划;参与基于Kubernetes调度系统的技术迭代,CPU与GPU/NPU等多元算力池化,支撑万卡级集群的高效运转与Agent运行时环境的资源隔离。
2、方案设计与核心研发:分析业务资源需求,设计异构算力协同与资源分配策略;参与调度器(Scheduler)的深度定制与二次开发,比如CPU在离线混部、GPU虚拟化(MIG/vGPU)、跨集群调度等,同时参与面向海量AI Agent的底层容器调度与隔离平台建设。
3、稳定性保障与性能优化:建立全链路可观测体系,快速定位并解决CPU负载异常、GPU硬件故障及调度延迟等线上难题;通过CPU/GPU潮汐混部、推理冷启动加速等手段,极致提升整体资源利用率并降低算力成本;利用AI Agent开发AIOps工具,实现故障自动排查与运维流程的自动化提效……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。