岗位描述(节选)
岗位职责:1、负责大模型在云端和院内部署环境中的推理服务化、国产化适配、性能优化和稳定运行,解决首token延迟、吞吐、显存、并发和多卡调度问题;
2、搭建模型推理服务;完成模型量化、并行推理、KV Cache优化、批处理和显存优化;
3、开展压测、容量规划、故障定位和SLA保障;
4、适配昇腾等国产算力环境。
任职资格:1、计算机、软件工程、人工智能等相关专业硕士及以上学历;具备2年以上模型部署、推理加速或高性能在线服务建设经验,熟悉大模型服务化落地流程;
2、熟悉主流大模型推理框架和服务化部署工具,掌握容器化、云原生部署与集群运维能力,具备 GPU/NPU 环境下模型部署、服务发布和运行维护经验;
3、掌握 Linux、CUDA/NPU 基础、性能分析、压测、监控告警等工程能力;理解量化、并行推理、KV Cache、吞吐与延迟权衡等推理优化机制,能够支撑高并发、低延迟、稳定可靠的模型服……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。