岗位描述(节选)
岗位职责:
1. 负责大语言模型的后训练全流程研发,包括SFT、RLHF、DPO、GRPO等主流后训练算法的落地与优化,提升模型在特定场景下的效果与对齐度。
2. 设计并搭建高效的后训练数据处理、训练、评测全链路pipeline,保障训练流程的稳定性、可复现性与高效率。
3. 针对模型幻觉、偏见、安全对齐等核心问题,研发针对性的后训练优化方案,持续提升模型的可靠性与合规性。
4. 负责大模型Agent能力的后训练对齐研发,包括Agentic Workflow的指令遵循、工具调用、多步推理、任务规划、长程记忆等核心能力的后训练优化,提升模型在Agent场景下的任务完成率与稳定性。
5. 探索并落地大模型前沿后训练技术,包括Process Reward Model(PRM)、Outcome Reward Model(ORM)、Agentic RLHF、多模态对齐、Constitutional ……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。