进入工作台 →

AI Infra Engineer(Agentic RL 训练框架)

🏢 小鹏鹏行📍 深圳、北京、上海
🎯 社招 发布于 2026-09-14 来源:中科创达招聘
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

【岗位职责】 参与机器人大模型强化学习训练框架的研发与优化,面向不同模型、训练方式和业务场景,完善训练与推理能力,提升框架的稳定性、扩展性和运行效率。通过框架开发、性能分析与算法工程协作,支撑大规模强化学习实验和业务训练,推动算法能力高效落地。 【职位描述】 1. 训练框架研发:负责强化学习训练框架的设计、开发与迭代,完善 GRPO、PPO、On-Policy Distillation 等训练方式的完整流程、数值正确性与运行稳定性,统一训练数据、优化目标与参数更新的扩展接口; 2. 核心模块与多后端适配:参与训练、推理、轨迹管理、奖励计算等核心模块研发,推进模块解耦与服务化,完善对 FSDP、Megatron、vLLM、SGLang 等训练与推理后端的适配层,支持不同模型、训练方式和业务场景的接入; 3. 评测与性能优化:建设核心训练场景的 benchmark、profiling 与 C…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 求职者营地 · 岗位数据受版权与反爬保护,禁止抓取与镜像