岗位描述(节选)
1、负责千卡以上大规模混合模态大模型强化学习训练框架建设,调研和实现业界先进的强化学习方法,并探索算法工程结合的训练方法创新设计,实现模型性能和训练效率的双提升;
2、打通复杂工具调用场景的高性能推理与Agent训练系统,攻克长程数据训练中的训练效率、训推一致性等难点,显著提升千问模型基于多种阿里生态工具(如闪购、飞猪等)的用户真实任务解决率;
3、参与奖励系统、工具系统交互的设计与研发,打造高效率的可持续扩展架构;并通过线上链路的联合设计保障模型训练效果的对齐,保障模型在事实性、复杂任务规划解决等方面的能力提点可以落地千问App。
【任职要求】
1、1年及以上大模型训练工程经验,有扎实的深度学习算法基础,精通各类大模型常用训练框架,熟练掌握各种编译、调试、性能分析工具;
2、熟悉强化学习算法PPO、DPO、GRPO、DAPO等以及相应的高效工程实现,有大模型强化学习工程支持经验和效果优……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。