岗位描述(节选)
1. 负责 LLM、CV、语音、多模态等模型在不同 GPU/NPU 硬件上的推理性能测试、调优和适配。
2. 负责 NVIDIA、AMD、国产卡等多硬件平台的 Benchmark 测试,输出模型、硬件、推理引擎维度的性能对比和选型建议。
3. 基于 TensorRT、vLLM、Triton、SGLang、TensorRT-LLM 等推理引擎,开展吞吐、时延、显存、Batch、KV Cache、并行策略等优化。
4. 基于 FLOPs、显存、带宽、Batch Size、Sequence Length、计算/访存比等指标进行性能建模,定位推理瓶颈并输出优化方案。
5. 与算法团队协作,理解模型结构、算子特性和精度约束,推动模型在目标硬件上的最优部署形态落地。
【任职要求】
1. 有 2 年以上 AI 推理部署、模型性能优化、GPU/NPU 适配或高性能计算相关经验。
2. 熟悉至少 2 种推……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。