岗位描述(节选)
岗位职责:
1. 规划GPU集群、存储、网络、容器和训练作业调度,支撑大规模多模态与具身模型训练;
2. 建设模型训练基础设施,适配FSDP、DeepSpeed、Megatron、Transformers等框架;
3. 打通数据集版本、训练配置、模型产物、实验追踪、评测结果和部署包管理;
4. 优化训练效率、稳定性、成本和可复现性,建立故障排查与资源使用规范;
5. 支撑训练、评测、部署全过程中的模型版本一致性和实验可追溯。
任职要求1. 本科及以上学历,计算机、人工智能、分布式系统等相关背景;
2. 5年以上AIInfra、MLOps、分布式训练平台或大规模工程系统经验;
3. 熟悉Linux、Docker/K8s、GPU/NCCL、分布式存储和网络性能优化;
4. 熟悉PyTorch分布式训练和主流大模型训练框架;
5. 具备系统设计能力,能在研发速度、稳定性和成本之间做工程取舍。
本站当前在招 1163 个上海技术研发岗位,其中 96 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 12K ~ 26K(25~75 分位),中位约 20K,最低 6K、最高 70K。
在招岗位较多的企业:米哈游 156 个拼多多 147 个阿里巴巴集团(含高德/阿里云) 122 个联影医疗 73 个恒瑞医药 59 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。