岗位描述(节选)
1. 参与大模型推理框架和分布式Serving系统的核心研发,面向语言模型、多模态模型和Agentic应用场景,建设高性能、高稳定性、高扩展性的生产级推理引擎;
2. 研发并优化Prefill/Decode分离、KV Cache管理、长上下文推理、多租户调度、连续批处理、SLO感知调度等核心系统能力,提升TTFT、TPOT、吞吐和资源利用率;
3. 参与分布式推理并行与通信优化,包括Tensor Parallel、Pipeline Parallel、Expert Parallel、Context Parallel、MoE All-to-All、跨机通信重叠、负载均衡和故障恢复等;
4. 协同算子、模型压缩、模型算法和业务团队,推动量化、投机解码、MoE优化、多模态推理、长上下文优化等能力在推理框架中生产落地,解决线上性能、稳定性和成本优化问题。
【任职要求】
1. 精通C++/Pytho……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。