岗位描述(节选)
● 参与超节点集群推理训练性能调优:深入AI大模型训练/推理业务场景,针对高密度并行算力流量与内存扩展访存特征,定位并解决性能瓶颈。
● 可靠性与稳定性体系建设,涵盖异常流量抑制、自愈机制设计,系统性降低组网故障概率。构建质量保障体系,设计多级流量优先级调度、拥塞调度。
● Scale-Up通信软件优化,包括软件研发与交付,如推理卡间通信、KV Cache优化。
● 评测体系与极限验证:搭建数据面性能基线、面向通信库、池化内存扩展评测体系,为软件迭代与架构演进提供量化依据。
● 参与具备竞争力的下一代基础设施架构定义:结合GPU互连技术演进与AI算力业务需求,参与下一代Scale-Up超节点互连架构、内存池化方案及数据面协议的设计与预研。
【任职要求】
● 计算机、软件工程、电子科学与技术、人工智能等相关专业。
● 5年以上软件研发或系统架构设计经验,精通C++或Python等编程语言,……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。