进入工作台 →

LLM Post-train 算法研究员(生产数据 / Agent 自进化方向)- AI引擎

🏢 米哈游📍 上海
🎓 硕士及以上学历 🎯 社招 来源:米哈游招聘
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

1. 负责基于公司真实生产数据(研发与内容生产过程中的任务记录、操作轨迹、产物、评审与返工记录)构建训练数据,打通数据采集、清洗、任务构造、训练、评测与回流的完整流程; 2. 搭建模型自我提升(RSI)的训练闭环:通过模型自生成数据、自我批判、迭代蒸馏、自动课程等方式,以可验证奖励和真实生产结果为训练信号,持续迭代模型能力; 3. 建立训练闭环的监控机制,及时发现能力漂移、reward hacking、分布偏移等问题,保证实验可回滚、可审计; 4. 独立完成 SFT、偏好对齐、强化学习(PPO / GRPO / DAPO 等)的训练与调参; 5. 设计 RL 任务与环境,构建 reward model、verifier 与规则校验,将任务完成标准转化为可训练的信号; 6. 建设离线与在线评测体系,以评测结果驱动版本迭代,给出模型上线、回滚的结论,并负责上线后的效果归因。 【任职要求】 1…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 求职者营地 · 岗位数据受版权与反爬保护,禁止抓取与镜像