岗位描述(节选)
1. 负责大模型(LLM/多模态生成/视觉理解等)推理引擎的性能优化与自研,包括调度策略、显存管理、算子融合、量化压缩等核心技术攻坚;
2. 深入 GPU/CPU 底层架构,通过 CUDA/Triton 自定义 Kernel 开发、软硬协同优化,提升 AI 模型在服务端和客户端的推理性能,降低计算成本与功耗;
3. 结合音视频/图像处理业务场景(编解码、画质增强、AI 视频分析等),推动 AI 高性能计算能力在多媒体算法中的工程落地与规模化应用;
4. 跟踪 AI 推理领域前沿技术(投机解码、KV Cache 优化、分布式并行、异构硬件适配等),持续输出可复用的性能优化方案。
【任职要求】
1. 精通 C/C++ 编程,熟悉 Python 编程,具备 Linux/Android/iOS 中至少一种系统平台的开发经验;
2. 熟悉 GPU 高性能计算,熟练掌握 CUDA/Triton 编程……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。