岗位描述(节选)
工作职责:
围绕自研大模型训推一体化平台,独立负责以下一个或多个方向的架构设计与落地:
1.大规模预训练资源调度设计 GPU 万卡级集群调度系统,支持拓扑感知、跨机房调度与多租户配额;基于 K8s/Volcano 等构建调度内核,训练任务排队、抢占、弹性调度,持续提升集群 GPU 利用率;拓扑感知放置(NVLink/IB)与跨机房/跨可用区调度,最小化跨交换机通信开销;通信与存储 IO 路径优化,配合训练框架提升端到端通信效率
2.自动故障检测与恢复:构建训练全链路健康监测与自愈闭环,最小化故障对训练进度的影响。训练全链路健康监测:NCCL hang、GPU Xid、网络抖动、存储异常的自动检测Checkpoint 自动管理 + 断点续训,故障迁移后快速恢复故障自愈闭环:检测 → 诊断 → 迁移 → 恢复,沉淀故障知识库与回溯能力
3.模型训推 DevOps打通"代码→镜像→训练→产物→上……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 9394 个上海岗位(全城各职能合计),其中 1138 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 7.5K ~ 20K(25~75 分位),中位约 12K,最低 0.8K、最高 100K。
在招岗位较多的企业:米哈游 618 个哔哩哔哩股份有限公司 432 个闻泰科技股份有限公司 409 个联影医疗 361 个阿里巴巴集团(含高德/阿里云) 319 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。