岗位描述(节选)
负责主流大模型在多种 AI 加速芯片和推理后端上的适配、优化与工程落地,覆盖 Qwen、DeepSeek、GLM、Kimi等文本、多模态与图像生成模型,目标平台包括 TPU、NPU 等各类 AI 加速芯片。该岗位需要深入理解模型结构、推理框架、算子/kernel、编译栈与分布式推理机制,推动模型在不同硬件平台上稳定、高效、可规模化运行。
【任职要求】
1. 负责 Qwen、DeepSeek、GLM、Kimi等主流模型在 TPU、NPU 等各类AI 加速芯片上的适配、验证和性能优化。
2. 分析模型结构与硬件特性,完成 attention、KV cache、MoE、多模态模块、DiT/扩散模型等关键链路的推理打通与优化。
3. 基于 vLLM、SGLang 或自研推理框架,推进模型部署、算子替换、图编译、kernel 调优和端到端性能优化。
4. 建立模型适配流程,包括精度对齐、性能 be……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。