岗位描述(节选)
1. 负责大模型通用能力及各专业垂类能力评测体系的建设与持续迭代,覆盖工程科学、数学、物理、化学、生物、医学、法律、金融、人文社科等核心方向,搭建科学、严谨、可复现的评测体系。
2. 围绕模型智能上限设计评测方案,通过高难度推理、复杂多步任务、长程规划等真实生产力任务检验模型的能力天花板,构建能有效区分模型能力层级的高区分度评测体系。
3. 深入分析模型在真实场景任务中的 bad case,精准归因问题来源(指令遵循失败、幻觉、上下文遗忘等),输出模型能力弱点分布图谱,为算法与训练团队提供可操作的优化方向与数据反馈。
4. 持续跟踪评测领域前沿方法,对现有评测基准进行充分调研与优缺点分析,建立评测数据的版本管理与防泄露机制,保障评测集的时效性与区分度。
5. 探索评测自动评估方案,研究主观评测新方法(如 LLM-as-Judge、对比评分、多维度量表等),将主观判断转化为可量化、可复现的评……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。