岗位描述(节选)
负责 AI 模型在多硬件平台的生产级推理部署、性能调优与稳定性保障,与算法团队紧密协作,输出最优部署方案。
核心职责:
1. 模型部署:负责 LLM、CV、语音等多类模型的推理服务化部署,覆盖 NVIDIA(CUDA / TensorRT)、AMD(ROCm) 及国产卡(昇腾 CANN、寒武纪、燧原、摩尔线程等) 硬件平台。
2. 推理引擎选型与调优:能基于业务场景(吞吐 / 时延 / 成本)对比 TensorRT、vLLM、Triton、SGlang 等引擎,输出选型与调优方案。
3. 性能建模与分析:基于 Roofline 模型、计算 / 访存比、并行策略、KV Cache、Continuous Batching 等进行量化分析,定位瓶颈并给出优化建议。
4. Benchmark 体系:搭建离线 / 在线压测与回归测试框架,输出量化评估报告。
5. 线上稳定性:推理服务监控、告警、异常……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。