岗位描述(节选)
1. 评测体系与标准构建:负责AI Agent、LLM(大语言模型)及VLM(视觉语言模型)的效果与性能评测体系建设。协同算法与产品团队,拆解业务场景,定义科学、客观且可量化的评测指标(Metrics),构建覆盖多场景、多难度等级的Benchmark。
2. 评测数据集建设与管理:设计并构建高质量、多样化的评测数据集(包括指令微调数据、偏好对齐数据等)。建立数据清洗、去重、质量校验的标准流程(SOP),确保评测数据的准确性与代表性,解决数据污染问题。
3. 自动化评测平台开发:搭建高效、可扩展的自动化评测流水线(Evaluation Pipeline),实现从数据输入到报告生成的全流程自动化。研发基于LLM的自动化打分模型(Judge Model/Reward Model),通过Prompt Engineering或SFT提升自动评测与人工评测的一致性(Correlation)。
4. 深……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。