岗位描述(节选)
团队介绍:
我们是京东云事业部AI Infra团队,致力于前沿的大模型技术创新与应用。我们专注于研发业界领先的大模型算法,构建极致高效的大模型训练与推理平台,提供高吞吐高可用、低成本低延迟的大模型服务。我们的核心使命是高效支持和驱动京东集团内外部的大模型业务生态及智能体应用,涵盖业界主流开源模型和京东自研模型的训练与推理服务。我们团队秉承技术驱动、创新为本的理念,为每一位成员提供广阔的成长空间和富有挑战性的项目。
1. 负责大模型推理服务的日常运维,保障服务发布、扩缩容与配置变更平稳执行;
2. 建立并维护监控告警体系,通过巡检脚本和看板快速发现并响应故障,确保服务高可用;
3. 分析延迟、吞吐、GPU利用率等核心指标,推动资源规划与成本优化,提升资源使用效率;
4. 组织故障复盘并协同研发团队推进根因整改,持续优化系统稳定性与运维流程。
【任职要求】
1. 具备AI推理服务运维经验,熟……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。