岗位描述(节选)
1、面向 NVIDIA GPU等主流AI 加速硬件,对大模型核心算子进行深度性能优化,极致压榨计算与访存带宽资源,显著提升端到端推理吞吐量与延迟表现。
2、设计并实现高精度、极低比特量化内核,在保障推理精度的前提下,大幅降低模型存储占用与计算开销,推动大模型在资源受限场景下的高效部署。
3、针对大规模分布式推理场景,研发计算-通信协同优化技术,有效隐藏通信延迟,提升多卡/多节点系统的可扩展性与资源利用率。
4、和基模算法团队紧密配合,联合设计下一代Qwen模型结构,通过端到端性能建模、算子定制与框架优化,确保下一代模型结构的推理效能。
【任职要求】
1、具备扎实的工程实现能力与良好的代码规范,熟练掌握 Python 和 C++,熟悉常用设计模式,能够独立完成复杂系统的架构设计、开发与调试。
2、拥有丰富的高性能计算内核(Kernel)开发经验,精通 CUDA / Triton / ROC……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。