岗位描述(节选)
【岗位职责】
1.开展强化学习在大模型上的探索工作,通过前沿研究和技术创新,优化RL训练Pipeline,提高模型的复杂推理和通用指令跟随能力。
2.开展强化学习在复杂Agent任务(例如Computer Use,Deep Research,AI IDE等)上的落地探索,拓宽大模型的应用边界。
3.对学术前沿保持跟进,鼓励将研究工作开源,并撰写论文或技术报告,促进团队内部以及与外部的技术交流。
【任职要求】
跟进RLHF/RFT主流研究方向,熟悉RLHF的pepeline,了解DPO/PPO/GRPO等常见算法的细节与差异,对reasoning 1.model的最新进展有跟进,优先考虑有相关训练算法训练与优化经验的同学。
2.有扎实的机器学习、深度学习、强化学习基础,能对训练中的现象进行合理分析,客观给出结论,并针对训练中的问题提出合理的新思路。
3.熟悉大模型和RLHF的常见训练框架,……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 8946 个北京岗位(全城各职能合计),其中 1913 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 5K ~ 13K(25~75 分位),中位约 8K,最低 2K、最高 300K。
在招岗位较多的企业:美团 1313 个阿里巴巴集团(含高德/阿里云) 797 个理想汽车 498 个京东 335 个小米集团 331 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。