岗位描述(节选)
【岗位职责】
参与智元具身智能云平台的计算基础设施建设,负责容器集群、GPU资源生命周期、通用调度和集群自愈能力。与平台研发、训练平台、存储及网络团队协作,将算力资源转化为可统一管理、稳定交付和持续优化的计算服务。
主要职责
1. 负责Kubernetes集群的建设与生命周期管理,完善节点接入、版本升级和容量扩展能力,持续提升多集群管理效率及资源交付的一致性。
2. 负责集群侧GPU运行时、设备插件及Operator的适配维护,协同集成团队验证驱动基线,建设设备发现、健康检查、资源上报与隔离机制。
3. 围绕资源池、队列、优先级和公平共享设计通用调度能力,根据平台配额及任务需求执行资源分配,优化任务等待时间、利用效率和调度稳定性。
4. 向训练平台提供计算资源及任务运行接口,协同完成分布式任务的资源准备、状态同步和异常处理,明确接口约定并保障跨组件协作可靠。
5. 建设集群故障发现、节点隔……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。