岗位描述(节选)
1. 负责大模型 Post-Training 全链路算法建设,覆盖 Pre-SFT、SFT、RLHF、RLVR(PPO / DPO / GRPO 等)各阶段的算法调优与策略设计,提升模型在指令遵循、工具调用、安全合规、多轮交互、long horizon task 等核心维度的综合能力。
2. 负责 Reward Model 的设计、训练与迭代优化,构建 Verifier、LLM as Judge、Rule 等多元 Reward System,优化多维度(安全性、准确性、有用性、逻辑性、拟人度等)的偏好数据采集策略与训练方案。
3. 设计高质量 SFT / RL 数据采集、清洗与标注方案,建立数据质量评估标准;通过实验驱动数据配比方法论,探索高质量数据合成、Agentic RL 等前沿方法,持续提升数据质量与多样性。
4. 参与模型合版工作,包括数据配比策略、多任务训练优化、灾难性遗忘缓解等……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。