进入工作台 →

大模型高性能推理研发工程师/专家

🏢 小红书📍 北京市,上海市,杭州市
🎯 社招 发布于 2026-09-22 来源:小红书招聘
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

工作职责: 1.端到端训练引擎建设: 参与开源大模型RL训练引擎Relax研发,突破 RLHF/DPO/GRPO/RLVR 等对齐技术的工程瓶颈,基于 Megatron/veRL 等框架优化分布式并行与动态协同,解决千卡规模下的显存与通信痛点。 2.推理框架与MaaS系统建设: 研发面向 LLM/MLLM/DiT 的高性能推理服务框架,主导 KV Router、PD 分离及请求动态调度能力建设,基于 vLLM、SGLang 等建设万亿级 Token 并行推理与服务高可用架构。 3.大模型加速算法落地: 探索并落地大语言模型及多模态模型的低比特量化(W8A8/W4A8等)、投机采样、CoT压缩、蒸馏、剪枝等算法,支持各业务大幅降低推理成本。 4.异构计算与底层优化: 主导基于国产异构计算芯片(昇腾 NPU 等)及主流 GPU 的软硬协同优化,负责 AI 框架适配、模型移植、关键算子开发与性能…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 求职者营地 · 岗位数据受版权与反爬保护,禁止抓取与镜像