岗位描述(节选)
工作内容:
1、针对主流大语言模型如Qwen等,在寒武纪平台开展端到端的推理性能优化和精度分析,提升模型推理效率及精度;
2、参与分布式推理框架设计开发,提供行业领先的LLM/多模态模型解决方案;
3、开发和维护大语言模型(LLM)量化工具等;
任职要求
1、计算机、电子工程、自动化、数学等相关专业优先;
2、精通Python/C++;
3、熟悉vLLM,SGLang等开源框架;
4、深入理解量化、KV Cache、多机多卡并行等加速技术。
加分项:
1、有大模型推理/加速相关开源仓库的贡献经验者优先;
2、参与过LLM或者视觉生成端到端推理优化项目,并实际落地;
3、具备CUDA或者其他AI加速卡的算子开发经验
4、熟悉torch.compile/CUDAGraph/Triton;