岗位描述(节选)
负责设计与构建下一代分布式 AI 推理 Runtime,让大模型服务启动更快、运行更稳、资源效率更高。你将参与解决大规模推理系统中的核心工程问题,包括:
1.推理实例极速弹性:通过容器镜像加速、模型与数据缓存、P2P 分发、预加载及 Checkpoint/Restore 等技术,持续降低模型加载与实例启动时间,提升大规模集群的弹性伸缩效率;
2.异构集群与分布式推理:支持不同模型和推理引擎运行在 GPU、NPU 等多种计算设备上,优化多节点之间的计算、通信与状态协同,探索更高效的并行与分布式推理架构;
3.模型 Day 0 上线:与模型、引擎及硬件团队紧密协作,理解新模型架构带来的系统需求,完成从 Runtime 适配、性能调优到规模化部署的完整链路,支持新模型快速稳定上线;
4.性能、稳定性与成本优化:通过系统架构优化、性能分析和工程创新,持续改善吞吐、延迟、可用性与资源利用率,支撑大规……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。