岗位描述(节选)
- 负责AI场景下存储方向性能分析,探索模型训练/推理与存储系统的深度集成,优化大模型训练/推理性能;
- 负责各GPU集群IO性能统计跟踪,数据缓存系统方案建设。
- 负责持续跟进大模型训练推理前沿技术和开源方案,结合存储完成场景化分析。
【任职要求】
- 本科及以上学历,计算机相关专业,具有存储领域相关工作经验;
- 有超大规模模型研发经验,涉及数据、训练、部署、评估等相关工作;
- 熟悉主要云厂商的AI Infra解决方案,有分布式存储项目经验;
- 熟悉gpfs、lustre等并行文件系统架构,能够定位处理存储集群的各类问题;
- 熟悉云存储技术及生态(如Juicefs、Alluxio、公有云对象存储);
- 精通一门或以上的脚本语言(如Python/Shell等),熟悉Go/C++等开发语言;
- 熟悉Linux系统、容器技术、云原生技术,能够支持相关服务部署及排障;
- 具有……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。