岗位描述(节选)
1. 深度挖掘大模型在复杂任务、长尾场景、不同语种下的弱点,设计并构建具有可扩展性的自动化评测方案及高质量数据集;
2. 参与 LLM-as-a-Judge 方案的设计与实现,训练高精度的 Reward Model(奖励模型),建模人类偏好,提升模型在指令遵循、安全性及复杂逻辑上的表现;
3. 设计高效的 Reward Signal(奖励信号)并合成对应数据,通过强化学习(RL)算法持续提升模型的能力上限与泛化性;
4. 参与开发 Evaluation 与 Reward System 所需的工程框架,简化多任务测试流程,提升大规模模型集成与实验的效率;
5. 跟踪全球大模型最新进展(如 Agent 评测、多模态对齐、自动化数据合成等),推动研究成果在真实业务场景中的落地。
【任职要求】
1. 硕士及以上学历,计算机、人工智能、软件工程、数学、自动化等相关专业优先;
2. 深入理解 Tra……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。