岗位描述(节选)
● 参与大模型推理框架的设计与研发,支持业界开源、蚂蚁内部大模型以及多模态模型的高效推理。
● 开展端到端性能分析与优化,覆盖推理调度、并行策略、KV Cache、量化、算子优化等,持续改善吞吐、时延和资源利用率。
● 参与在线推理服务框架的设计与演进,建设模型部署、服务编排、流量治理和多模型、多模态服务能力。
● 设计并优化在线请求调度、RPC 通信和端到端数据通路,在高并发和强 SLA 场景下平衡吞吐、时延与资源隔离。
● 建设推理服务的可观测行和容错能力,完善监控、诊断、限流、降级与故障恢复机制,提高系统稳定性和工程质量。
● 跟进 SGLang、vLLM、TensorRT-LLM、FlashInfer、Triton Inference Server 等推理框架和基础组件,推动先进方案在内部系统及开源社区落地。
【任职要求】
● 计算机基础扎实,熟悉 Linux 环境下的系统开发、……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 776 个北京技术研发岗位,其中 29 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 12K ~ 20K(25~75 分位),中位约 20K,最低 4K、最高 50K。
在招岗位较多的企业:理想汽车 241 个阿里巴巴集团(含高德/阿里云) 109 个京东 73 个美团 72 个小红书 55 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。