岗位描述(节选)
岗位职责:
1、 围绕语言、多模态与 Agent 能力,探索预训练架构、后训练 SFT 数据配比、SFT 策略、SFT 与 RL 协同策略及 RL 训练算法;
2、 研究面向 Agentic、Reasoning、Coding、General等高优场景的针对性 Reward System 构建、环境模拟与训练策略;
3、 研究强化学习算法与训练稳定性提升方法,包括但不限于重要性采样策略、细粒度 Reward 设计、Credit Assignment 策略、Off-policy Masking 等提升 RL 训推一致性的策略;
4、 探索 Model Merge(模型融合)、On-policy KD(在线蒸馏)、Multi-task RL(多任务强化学习)等专项能力融合策略,推动模型综合能力提升;
5、 推动后训练与强化学习方案在真实业务和模型迭代中验证落地,形成可复用、可规模化的训练策略与工……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。