岗位描述(节选)
我们希望你参与
* 建设可持续演进的大模型评测体系;
* 提升评测自动化程度与评测效率;
* 推动评测数据、评测框架与评测方法持续迭代;
* 用系统化评测驱动模型能力提升。
1. 负责大语言模型(LLM)评测体系建设,包括评测方案设计、评测指标定义、评测流程标准化等,建立可持续演进的评测能力体系;
2. 负责 Public Benchmark 与 In-house Benchmark 的建设与维护,包括评测集构建、数据清洗、版本管理、持续迭代与优化;
3. 根据模型迭代重点与业务需求,持续补充评测维度,动态优化评测集结构,提升评测集有效性与区分度;
4. 深入分析模型能力边界与问题分布,识别模型优势、短板与退化风险,建立问题发现与质量拦截机制;
5. 跟踪行业模型发展趋势,对主流模型进行横向评测与能力分析,量化模型能力变化与行业水平;
6. 参与模型训练与迭代过程中的评测建设,支撑模……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。