岗位描述(节选)
1.负责 A100/H100 GPU 集群部署、配置与资源调度,基于 Slurm、K8s+Volcano 搭建算力调度体系,管理显存分配、多卡并行任务;开展算力容量监控与规划,输出扩容方案。运维 PyTorch DDP、DeepSpeed、Megatron 等分布式训练环境,管理 Ceph、NAS、对象存储;部署维护 vLLM、Triton、TGI 推理服务,配置负载均衡、限流熔断,监控 TTFT、TPS、时延等 SLA 指标;负责 Milvus 等向量数据库、全链路数据 Pipeline 运维优化。落实访问权限管控,通过弹性调度、量化优化提升 GPU 利用率,持续优化算力运营成本。
2. 搭建多源异构数据采集管线,完成文本、音视频数据清洗、去重、脱敏;制定标注规范,统筹标注管理,构建高质量训练数据集;开展特征工程,搭建标准化特征库。结合业务完成 LLM、CV 等模型架构选型;负责模型预训……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。