岗位描述(节选)
我们是专注于大模型服务平台的技术团队,我们的核心业务是提供高效稳定的大模型推理服务API,帮助各行各业轻松利用大模型的强大能力,正在寻找一位有实力的Site Reliability Engineer (SRE) 加入我们,共同打造更可到的大模型服务平台。
负责AI基础设施算力资源的规划、运营管理与精细化数据体系建设。通过系统化、数据化方法提升GPU资源利用率、周转率与成本效益,保障AI训练/推理任务的高效稳定运行,支撑业务快速发展。
【工作职责】
1.大模型服务和平台的稳定性保障与体系建设:负责大模型相关核心业务系统和模型服务的稳定性建设工作,提升业务可用性与可靠性;
2.高并发流量治理:高并发场景下的流量治理方案设计与实施,包括熔断、限流、降级等容灾策略,确保业务弹性与鲁棒性;
3.GPU算力资源规划与运营管理:包含不限于优化GPU资源配置模型,平衡计算性能与成本,推动资源采购决策与部……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。