岗位描述(节选)
1、端侧部署加速:负责模型在边缘设备的部署,开展量化、剪枝、蒸馏及算子融合等轻量化技术的研发与工程落地;
2、云端推理优化:基于 vLLM、Triton 等框架进行大模型推理服务的架构设计与调优,优化 KV Cache 与动态批处理,提升高并发吞吐量;
3、底层算子开发:参与 CUDA 等高性能算子开发与图编译优化,解决显存溢出及长稳运行等工程难题。
1、计算机、AI等相关专业本科及以上学历;
2、精通 C/C++ 与 Python,熟悉 Linux 开发环境;
3、深入理解 Transformer 架构,熟悉 vLLM、TensorRT 等推理框架及模型压缩技术;
4、具备 CUDA Kernel 开发、ACM 竞赛获奖或开源推理框架贡献经验者优先。