岗位描述(节选)
我们关注模型训练系统,为深度学习模型训练和超大规模训练提供算力基座,包括但不限于以下职责:
1、基于阿里云原生底座,设计实现数万卡规模的多租户、多种异构硬件、高性能计算集群的调度系统;
2、研发轻量级的训练重启、故障备份迁移、代码-依赖分发系统,面向有效训练时间极致优化;
3、针对基座模型训练,打造全面的可观测、可视化系统,洞察全生命周期软硬件故障动态;
4、结合大规模分布式训练框架、前沿的异构硬件,分析并解决预训练、后训练过程中软硬件缺陷;
5、构建大模型的模型训练、模型评测、模型管理、模型交付在内的MLOps平台;
6、平台化的支撑多模态生成模型的训练、迭代,以及在AIGC场景的生产化落地应用。
【任职要求】
1、有扎实的工程算法基础,精通数据结构和常用算法,熟练掌握各种编译、调试、性能分析工具;
2、有极佳的工程实现能力,精通Java、Go、Python之一;
3、有调度系统开发经……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。