岗位描述(节选)
【岗位职责】
- 研究和优化大模型强化学习(RLHF、RFT、ReFT、RL等)相关的核心算法;
- 设计并实现强化学习训练管道,包括奖励建模、策略优化、数据收集等;
- 结合SFT(监督微调)+ RL 训练范式,提升大模型在Agent开放领域任务(如Computer Use、搜索、自动代码软件开发等)上的表现;
- 关注大模型强化学习最新进展,撰写技术文档和研究报告,为团队提供技术支持。
【任职要求】
- 有RLHF对齐策略 经验,能优化人类偏好建模;
- 参与过开放领域大模型训练(如ChatGPT、Gemini 方式的RL训练);
- 计算机科学、机器学习、人工智能等相关专业,硕士及以上学历(博士优先);
- 深入理解强化学习(RL)原理和在大模型领域的应用
- 具备数学功底(统计、优化、信息论等),能独立阅读顶会论文(NeurIPS/ICLR/ICML)并实现;
- 有大规模分布式……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 9013 个北京岗位(全城各职能合计),其中 1969 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 5.2K ~ 14K(25~75 分位),中位约 8K,最低 2K、最高 300K。
在招岗位较多的企业:美团 1313 个阿里巴巴集团(含高德/阿里云) 797 个理想汽车 498 个京东 335 个小米集团 331 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。