岗位描述(节选)
【工作职责】
1.针对大模型推理中的 GEMM、Attention、MoE 等核心计算,使用 CUDA、CUTLASS、Triton或 TileLang
进行实现和优化。
2.结合 CUDA Core、Tensor Core 和 GPU 内存层级,改写算子融合、数据布局、任务切分及流水执行方式,减少访存、同步和
Kernel Launch 开销。
3.针对 Prefill、Decode 等不同负载,优化 Kernel 选择、CUDA Graph 及任务调度策略,提升吞吐、时延和计算资源利用率。
4.紧贴模型结构和推理算法演进,与框架及芯片团队共同设计硬件友好的计算流程,并对真实推理负载持续进行性能分析。
【核心要求】
1.熟悉 C/C++和 CUDA,具备 GPU Kernel 开发及性能优化经验。
2.深入理解 GPU 体系结构,熟悉 CUDA Core、Tensor Core、Warp……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。