岗位描述(节选)
1. 负责模型训练场景中高性能计算Pipeline的实现,通过访存算子优化、算子融合、MoE/Attention算子定制,实现精细化显存管理、最大化计算/访存效率。
2. 负责结合大语言模型、多模态理解生成模型、Agentic RL等场景的模型训练需求进行算子设计,实现模型-Infra的Co-Design。
3. 负责世界模型、实时生成交互等场景的高性能低延迟算子设计和实现,满足模型加速上线的需求。
4. 使用专业的Profiling工具和手段,对大模型训练的端到端性能进行分析,精准定位Kernel执行、数据搬运、通信等环节的瓶颈,并提出体系化的优化方案。
5. 跟进业界SOTA的高性能计算工作,调研并实施异构硬件在超大规模训练场景的落地方案。
【任职要求】
1. 工程与算法基础:计算机相关专业背景,有极佳的工程实现能力,精通 C/C++ 与 Python;具备扎实的数据结构与算法功底,……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。