岗位描述(节选)
1. 参与大模型推理系统的架构设计与开发,包括推理网关、请求调度、流量路由等核心模块的建设
2. 负责推理引擎(vLLM/SGLang等)的深度优化与定制化开发,提升推理吞吐与延迟表现
3. 参与PD分离(Prefill-Decode)架构的设计与开发,优化Prefill与Decode阶段的资源分配与协同调度
4. 负责KV Cache存储与管理系统开发,包括KV Cache迁移、共享、淘汰策略的设计与实现
5. 参与模型分发系统开发,支持大模型在多节点间的高效分发与加载
6. 基于线上监控与用户反馈,持续优化推理链路的性能、稳定性与成本效率
【任职要求】
1. 计算机相关专业,具有五年以上Golang、Python或C++开发经验
2. 熟悉vLLM、SGLang等开源推理引擎的架构与实现,了解Continuous Batching、PagedAttention等核心机制
3. 深入理……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。