进入工作台 →

晓天衡宇-大模型评测工程师-代码方向(北京)

🏢 阿里巴巴控股集团📍 北京
🎓 本科 🧭 3年以上 🎯 社招 发布于 2026-08-14 来源:阿里巴巴招聘
登录查看完整 JD、匹配评分与投递包

岗位描述(节选)

1、负责代码评测集的建设、维护与迭代,覆盖 SWE-bench 系、Terminal-Bench、LiveCodeBench、BigCodeBench、SciCode 等主流评测集,把控子指标权重与维度聚合口径。 2、负责 CodeArena 人工对战评测的设计与运营,制定打分标准与评委质检机制。 3、负责代码 badcase 的人工分析与三轴归因体系落地,即表现层(可运行性、内容、功能、视觉)、根因层(意图偏差、指令遵循、知识缺失、能力不足、幻觉)及对战相对结论,产出 Coding 能力榜与短板诊断报告。 4、负责评测数据的采集、清洗、去重、脱敏与格式标准化,保障数据质量与样本代表性。 5、负责标注任务的设计、质检与一致性管理,建立评测结果的入库、聚合与可视化流程,维护题库版本与数据溯源机制。 6、负责评测数据结构设计与自动化能力建设,包括模型、成本、token 消耗等数据表设计及批量编…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 职通车AI · 岗位数据受版权与反爬保护,禁止抓取与镜像