岗位描述(节选)
1. 面向具身智能、多模态 VLA/VLM、机器人策略模型等推理场景,设计并实现高性能 CUDA/C++ 算子。
2. 针对 H系列 GPU 与 RTX 4090 等硬件平台,进行端到端推理性能优化,包括延迟、吞吐、显存占用和稳定性优化。
3. 打通具身模型推理机部署流程,支持模型导出、量化、TensorRT/TRT-LLM 编译、服务化部署与性能 profiling。
4. 有 LLM/VLM/VLA 推理链路中的关键模块的优化经验,包括 attention、KV cache、视觉编码器、动作头、后处理等。
5. 针对跨卡、跨机推理通信场景,开发和优化 NCCL/RDMA/NVLink/PCIe 相关通信算子与调度策略。
【任职要求】
1. 计算机及相关专业,本科及以上学历。
2. 具备扎实的 C/C++ 编程能力,良好的数据结构和算法基础。
3. 理解操作系统、计算机体系结构和 GP……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。