进入工作台 →

模型后训练算法专家

🏢 联想📍 北京
🎯 社招 发布于 2026-08-19 来源:联想集团招聘
登录查看完整 JD、匹配评分与投递包

岗位描述(节选)

岗位职责: 1. 负责大语言模型的后训练全流程研发,包括SFT、RLHF、DPO、GRPO等主流后训练算法的落地与优化,提升模型在特定场景下的效果与对齐度。 2. 设计并搭建高效的后训练数据处理、训练、评测全链路pipeline,保障训练流程的稳定性、可复现性与高效率。 3. 针对模型幻觉、偏见、安全对齐等核心问题,研发针对性的后训练优化方案,持续提升模型的可靠性与合规性。 4. 负责大模型Agent能力的后训练对齐研发,包括Agentic Workflow的指令遵循、工具调用、多步推理、任务规划、长程记忆等核心能力的后训练优化,提升模型在Agent场景下的任务完成率与稳定性。 5. 探索并落地大模型前沿后训练技术,包括Process Reward Model(PRM)、Outcome Reward Model(ORM)、Agentic RLHF、多模态对齐、Constitutional …… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 职通车AI · 岗位数据受版权与反爬保护,禁止抓取与镜像