岗位描述(节选)
1. 模型部署与适配:负责 Qwen、DeepSeek、GLM 等主流开源大模型(含 MoE、长上下文)的部署、适配与上线,沉淀标准化方案。
2. 推理性能优化:围绕吞吐、首 token 时延、显存占用与单位 token 成本做系统性调优;基于 vLLM / SGLang / TensorRT-LLM 做源码级改造,优化 Continuous Batching、量化与并行策略等。
3. PD 分离部署与 KV 缓存优化:推进 Prefill / Decode 分离部署架构落地,优化两阶段资源配比、KV 传输与调度策略;负责 KV Cache 分页管理、Prefix Cache 复用、缓存量化与多级卸载,降低显存占用并提升长上下文与高并发场景下的吞吐。
4. 评测体系建设:搭建效果与性能评测能力,支撑模型选型与上线决策;对量化、蒸馏等优化建立精度回归流程,确保“提速不掉点”。
5. MaaS……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。