岗位描述(节选)
1、负责代码评测集的建设、维护与迭代,覆盖 SWE-bench 系、Terminal-Bench、LiveCodeBench、BigCodeBench、SciCode 等主流评测集,把控子指标权重与维度聚合口径。
2、负责 CodeArena 人工对战评测的设计与运营,制定打分标准与评委质检机制。
3、负责代码 badcase 的人工分析与三轴归因体系落地,即表现层(可运行性、内容、功能、视觉)、根因层(意图偏差、指令遵循、知识缺失、能力不足、幻觉)及对战相对结论,产出 Coding 能力榜与短板诊断报告。
4、负责评测数据的采集、清洗、去重、脱敏与格式标准化,保障数据质量与样本代表性。
5、负责标注任务的设计、质检与一致性管理,建立评测结果的入库、聚合与可视化流程,维护题库版本与数据溯源机制。
6、负责评测数据结构设计与自动化能力建设,包括模型、成本、token 消耗等数据表设计及批量编……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。