岗位描述(节选)
1、负责大模型 MaaS 平台核心后端能力建设,支撑公司内外部大模型推理、部署、调用与运维场景;
2、负责大模型推理服务的稳定性体系建设,包括高可用架构、限流降级、熔断容灾、故障自愈、容量治理、SLA 保障等;
3、负责大模型推理流量调度能力建设,包括多模型、多集群、多地域、多租户场景下的流量路由、负载均衡、灰度发布、弹性调度与成本优化;
4、负责模型服务编排与部署系统建设,支持模型实例生命周期管理、自动化部署、版本管理、滚动升级、弹性伸缩、资源隔离与异构资源调度;
5、深入优化推理链路的性能与资源利用率,包括请求排队、批处理、缓存、并发控制、GPU/CPU 资源利用、延迟与吞吐优化等;
6、建设平台可观测能力,包括指标、日志、链路追踪、告警、故障诊断工具和稳定性运营看板,提升问题发现、定位和恢复效率;
7、与算法、基础架构、业务团队协作,抽象通用平台能力,推动大模型能力标准化、产品化和规……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。