岗位描述(节选)
1. 主导高扩展性、高吞吐量AI基础设施平台的设计与构建,基于VLLM、SGLang等前沿推理框架,搭建支持多模态大模型的分布式推理系统,实现动态资源调度与低延迟响应
2. 构建智能化资源调度策略与弹性扩缩容机制,保障高并发场景下推理服务的稳定性与资源利用率最大化
3. 解决大规模分布式场景下的性能瓶颈,优化GPU集群资源利用率及端到端推理吞吐量,降低推理成本并提升TTFT、TPOT等指标
4. 跟踪AI基础设施领域(AI Infra)技术趋势,包括但不限于分布式推理优化、模型即服务(MaaS)、自动化模型部署(AutoML)等,结合业务场景进行技术选型与创新性实践
5. 设计并实现AI推理服务效能监控看板与端到端可观测性(Observability)系统,通过实时指标分析(如token消耗、GPU利用率、延迟分布)驱动业务侧资源优化。
6. 构建数据驱动的A/B测试与成本分析模型,为业务……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。