岗位描述(节选)
1)评测体系搭建:负责游戏体验与角色扮演场景下大模型的全链路评测体系建设,设计覆盖多维度的评测指标体系(如角色一致性、对话连贯性、情感表现力、安全性、创意性等),建立从数据构建→评测执行→结果分析→问题定位→模型迭代的完整评测流水线
2)自动化评测方案:设计并落地多层级自动化评测方案,包括但不限于:基于规则/脚本的自动化测试、训练专用评测小模型(Reward Model/Classifier)、基于大语言模型的 LLM-as-Judge 评估、基于 Rubric 的生成式评分方案,持续提升评测效率与覆盖度
3)人工评估与标注管理:设计人工评估方案与标注规范,管理标注团队与标注流程,建立人工评估与自动化评估的校准机制,确保评测结果的可靠性与一致性
4)数据飞轮与持续迭代:构建"评测—发现问题—数据积累—模型优化—再评测"的数据飞轮闭环,系统性沉淀 Bad Case 库、评测集、评测基准,支撑……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。