岗位描述(节选)
推理方向:
负责模型推理引擎的选型、优化与定制开发,探索PD分离(Prefill-Decode Disaggregation)架构,保障线上推理服务的高吞吐、低延迟和高可用。
推进推理侧的关键技术优化,包括KV Cache管理(PagedAttention、多级缓存、KV Cache Offload)、量化压缩(FP8/INT8/INT4)、Continuous Batching、Chunked Prefill、Speculative Decoding、CUDA Graph优化等,持续提升推理效率和资源利用率。
设计和构建模型部署服务平台,涵盖模型版本管理、灰度发布、任务分发与路由、负载均衡、弹性扩缩容、资源池化与应用混部等能力。
管理高性能GPU计算集群,负责集群资源调度、监控告警、故障恢复等运维保障工作。
与医学算法、产品、运营以及业务工程团队通力合作,推进医学AI产品和技术的发展和应……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。