岗位描述(节选)
1. 大模型算子开发与全链路性能优化:负责 GPU 及各类 AI 加速芯片的底层算子研发与调优。针对大模型训练与推理场景,开展全链路性能剖析与瓶颈定位;通过指令级优化、内存访问重构等手段,实现核心算子在异构硬件上的极致性能释放。
2. AI 编译优化、Mega Kernel 与模型量化压缩:参与 AI 编译器栈的深度定制与优化,打通从上层框架到底层硬件的计算图下沉与自动调优链路。主导 Mega Kernel 技术落地,通过多算子深度融合减少全局内存读写与 Kernel Launch 开销;结合量化压缩技术,在保障精度的前提下大幅降低显存占用与延迟,实现低成本部署。
3. 分布式架构设计与计算通信融合:面向大规模集群,设计并优化大模型训练与分布式推理架构。深入实践张量并行、流水线并行等策略,攻克多机多卡网络通信瓶颈;通过计算与通信深度融合(如 Overlap 调度),提升集群算力利用率与扩展……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。