岗位描述(节选)
1. 超大规模训练架构:负责百亿至万亿参数模型的分布式训练架构设计与演进。针对数千卡 GPU 互联场景,通过自顶向下的性能分析,利用 5D 并行以及通信优化策略,消除大规模分布式训练瓶颈,提升训练效率和线性加速比。
2. 极致性能优化与算子开发:深入软硬协同层,通过手写 CUDA / Triton 算子、算子融合及 XLA / MLIR 等编译优化技术,挖掘 GPU 硬件极致算力,打造一流的执行引擎,追求业界SOTA的 MFU。
3. 训练框架演进:结合前沿的大语言模型(LLM)与多模态模型结构,协同算法团队进行框架级优化(如 Checkpointing、显存优化、Overlap 通信掩盖),优化单位算力的模型效果。
4. AI 创新应用落地支撑:作为算力基座的核心支撑,支持行业顶尖的 GPT、AIGC、多模态模型在 AI 创新应用场景的业务落地,解决实际业务中的大规模与稳定性挑战,确保模……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。