岗位描述(节选)
1. 负责基于公司真实生产数据(研发与内容生产过程中的任务记录、操作轨迹、产物、评审与返工记录)构建训练数据,打通数据采集、清洗、任务构造、训练、评测与回流的完整流程;
2. 搭建模型自我提升(RSI)的训练闭环:通过模型自生成数据、自我批判、迭代蒸馏、自动课程等方式,以可验证奖励和真实生产结果为训练信号,持续迭代模型能力;
3. 建立训练闭环的监控机制,及时发现能力漂移、reward hacking、分布偏移等问题,保证实验可回滚、可审计;
4. 独立完成 SFT、偏好对齐、强化学习(PPO / GRPO / DAPO 等)的训练与调参;
5. 设计 RL 任务与环境,构建 reward model、verifier 与规则校验,将任务完成标准转化为可训练的信号;
6. 建设离线与在线评测体系,以评测结果驱动版本迭代,给出模型上线、回滚的结论,并负责上线后的效果归因。
【任职要求】
1……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。