进入工作台 →

智能引擎-大模型训练平台研发工程师-AI Infra

🏢 阿里巴巴控股集团📍 北京/杭州
🎓 本科 🧭 3年以上 🎯 社招 发布于 2026-08-27 来源:阿里巴巴招聘
登录查看完整 JD、匹配评分与投递包

岗位描述(节选)

我们关注模型训练系统,为深度学习模型训练和超大规模训练提供算力基座,包括但不限于以下职责: 1、基于阿里云原生底座,设计实现数万卡规模的多租户、多种异构硬件、高性能计算集群的调度系统; 2、研发轻量级的训练重启、故障备份迁移、代码-依赖分发系统,面向有效训练时间极致优化; 3、针对基座模型训练,打造全面的可观测、可视化系统,洞察全生命周期软硬件故障动态; 4、结合大规模分布式训练框架、前沿的异构硬件,分析并解决预训练、后训练过程中软硬件缺陷; 5、构建大模型的模型训练、模型评测、模型管理、模型交付在内的MLOps平台; 6、平台化的支撑多模态生成模型的训练、迭代,以及在AIGC场景的生产化落地应用。 【任职要求】 1、有扎实的工程算法基础,精通数据结构和常用算法,熟练掌握各种编译、调试、性能分析工具; 2、有极佳的工程实现能力,精通Java、Go、Python之一; 3、有调度系统开发经…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 职通车AI · 岗位数据受版权与反爬保护,禁止抓取与镜像