岗位描述(节选)
1、负责 LLM 人工评测竞技场(Arena)的整体设计与运营,统筹题库构建、对战机制、评委组织与排名算法。
2、负责评测题库的规划与建设,覆盖创作、设计、中文、GUI 等重点场景,把控自建题占比与数据来源分类(开源/自建/混合),保证题目的区分度与抗刷分能力。
3、负责 Elo/BT + bootstrap 排名体系的落地与维护,处理胜率矩阵的传递性、一致性与显著性问题,确保结论的统计可靠性。
4、负责 AI Agent 办公助手类产品(如 QwenWork、WorkBuddy 等)的端到端评测,围绕真实办公工作流构建任务集,覆盖文档处理、数据分析、跨应用协作、检索问答等场景。
5、建立端到端成功率与分步归因指标体系,评估任务完成度、多步推理与工具调用、长上下文与记忆、稳定性与可用性等能力,输出产品横向对比与迭代建议。
6、负责榜单口径的统一维护,制定在榜数量与版本汰换规则,定期产出能力……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。