岗位描述(节选)
1. 设计并实现高可用的大模型服务化部署调度,支持多用户并发、低延迟、弹性伸缩;
3. 深入跟进团队内训练/推理相关的性能优化工作,解决实际业务场景中的性能瓶颈;
3. 持续跟进 AI Infra、分布式系统与推理优化前沿技术,推动新技术的验证与落地。
【任职要求】
1. 具有一定的具备 GPU 性能优化经验,包括但不限于 CUDA/Cute/Triton/TileLang 等;
2. 扎实的系统与基础设施能力,熟悉 Linux 环境下高性能服务开发,具备良好的代码规范和系统设计能力;
3. 具备较丰富的大模型(LLM/DiT 范式)等推理服务优化经验,了解常用推理优化方案,对 DiT 模型的推理优化有深入理解者优先考虑;
4. 熟练掌握常用 AI Coding 工具,能够将 AI 协同开发融入日常研发流程;
5. 具有独立解决问题的能力,良好的团队合作精神及沟通能力。