岗位描述(节选)
职位职责:
1、服务器与算力架构规划:负责根据业务要求进行算力中心服务器架构设计、选型评估及算力资源池化方案,参与硬件配置评审,确保架构匹配算力需求。与模型研发团队对接,理解模型训练流程中的算力痛点,转化为服务器配置、网络拓扑、存储分层等架构方案。
2、算力平台软件运维与调优:负责服务器系统、K8S集群、MaaS平台、分布式存储及高速网络的软件运维,保障业务稳定运行。负责CPU/GPU算力环境的软件治理,建立算力效能基线,包括CUDA/cuDNN/驱动/容器配置、性能调优与故障排查。
3、算力分配与资源治理:设计多租户、多任务场景下的算力分配策略(队列、优先级、抢占、配额),提升GPU利用率与研发效率。搭建监控告警体系,对核心指标做可视化与预警,主导线上故障处理与复盘。
4、运维自动化:后续牵头搭建并带领运维团队制定运维规范、变更流程与应急预案,推动运维自动化与自愈能力建设。引入CI/CD……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。