岗位描述(节选)
1、负责大模型平台底层软件基础设施的架构设计、开发搭建与迭代升级,涵盖模型训练、推理、部署全流程配套底层系统,针对平台稳定性、兼容性、扩展性进行持续优化,解决大规模模型落地中的底层软件瓶颈问题,支撑大模型业务规模化运行;
2、参与大模型算力集群的智能化管理与调度系统研发,优化AI算力资源分配、任务排队、资源复用策略,通过算法优化、策略迭代提升算力利用率,降低平台运行成本,解决算力碎片化、任务拥堵、资源浪费等核心痛点,实现算力资源的高效智能调度;
3、负责大模型基础设施平台的可观测体系建设,搭建高性能、高实时性的数据采集、传输、清洗、分析数据管道,覆盖算力状态、模型运行、集群负载、链路延迟等全维度监控指标;优化观测数据精度与分析效率,实现平台故障智能预警、根因定位、性能瓶颈挖掘,提升平台运维智能化水平;
4、针对大模型基础设施平台的响应延迟、吞吐能力、并发承载、资源功耗等核心性能指标开展专项……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。