岗位描述(节选)
1、参与大模型(LLM)推理引擎的开发和优化,包括但不限于算子优化、显存管理、量化压缩等;
2、实现并改进推理加速技术(如FlashAttention、PagedAttention、ContinuousBatching、SpeculativeDecoding等);
3、针对国产芯片(如昇腾、昆仑芯、海光等)进行算子级与框架级调优;
4、分析模型推理性能瓶颈,设计针对性优化方案,降低延迟和提高吞吐量;
5、跟踪前沿推理加速论文与开源项目(如vLLM、TensorRT-LLM、SGLang、LMDeploy等),并进行落地验证。
【任职资格】
1、博士学历,计算机、人工智能、数学等相关专业;
2、具备良好的编程能力,熟练掌握C++/Python语言,有AscendC算子开发经验者优先;
3、熟悉Transformer模型结构及常见推理优化技术(如量化、稀疏化、算子融合、KVCache优化等)……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。