岗位描述(节选)
工作职责:
1.基于开源推理平台建设AI推理服务底座,负责推理管控层服务与GPU工作节点集群部署、调优与二次开发;完成模型准备、量化、推理引擎(vLLM/SGLang/TensorRT-LLM)适配部署。
2.设计跨机、跨节点的分布式 KVCache 共享与迁移方案,实现 KVCache 在GPU HBM /CPU DRAM / NVMe SSD 多级存储间的高效卸载(Offload)与加载,针对长上下文、多轮对话场景优化 KVCache 的存储与传输效率。
3.设计实现模型分布式部署:张量并行、流水线并行,基于Ray协调跨节点通信;配置 HPA弹性伸缩,实现空闲节点回收。
4.负责K8S资源编排,GPU资源调度,完成单集群向多集群联邦架构演进;实现推理任务故障迁移,保障集群高可用。
5.对接上层AI网关,打通端到端完整业务链路;搭建S3兼容模型存储体系;完成硬件、推理引擎全链路可观测、告……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。