岗位描述(节选)
1、负责大模型高性能推理核心技术研究与优化,面向 Dense、MoE 等不同模型架构,围绕吞吐、时延、显存/内存利用率及资源效率开展系统性优化,持续提升大模型在线推理服务性能。
2、负责大模型推理框架优化,深入研究 vLLM、SGLang等主流推理框架,开展调度策略、并行策略、显存管理、模型加载、通信及计算优化,推动推理框架在 GPU、NPU 等异构算力平台上的高效适配与落地。
3、负责 KV Cache 体系及长上下文推理优化,研究 Prefix Cache、多级 KV Cache、HBM/DRAM 分层缓存、Cache-aware/Affinity Scheduling 等关键技术,提升长上下文及高前缀复用场景下的缓存命中率与推理效率。
4、负责大模型分布式推理架构研究,探索 Prefill-Decode 分离、TP/DP/EP 并行、MoE Expert Parallel、动态专家负……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。