岗位描述(节选)
【工作职责】
1.针对 Transformer、MoE 及多模态模型,分析 Prefill、Decode
阶段的计算、访存和数据流特征,建立真实推理负载的性能模型。
2.在不改变模型语义的前提下,重构推理计算流程,减少冗余计算、数据搬运和同步开销,提升端到端执行效率。
3.研究并落地投机解码、KV Cache 复用与管理、长序列推理等优化方案,并与推理引擎团队共同完成系统实现。
4.开展 FP8、FP4、INT8、INT4 等低精度推理研究,负责量化策略、误差分析、混合精度及硬件适配。
5.基于模型结构和真实推理负载,与系统及芯片架构团队开展软硬件协同设计,提炼计算、存储、互联和数值精度需求,参与下一代 AI芯片的架构定义与验证。
【核心要求】
1.熟悉 Python、C/C++和 PyTorch,具备良好的算法实现及系统开发能力。
2.深入理解 Transformer、Attention……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。