岗位描述(节选)
1. 负责 Coding、Agent 类开源/自建评测集清洗与标准化处理;
2. 将评测集接入公司评测平台,完成数据格式转换、Solver/Scorer 适配与运行调试;
3. 搭建和维护评测所需的运行环境(Docker 沙箱、浏览器环境、工具链等);
4. 执行评测任务,排查运行异常,保障评测结果稳定、可复现;
5. 输出评测集接入文档与结果分析报告。
【任职要求】
1. 本科及以上学历,计算机相关专业,2 年以上工程开发经验;
2. 熟练掌握 Python,熟悉 Docker、Linux、Git 等常用工程工具;
3. 了解大模型基本原理,有 LLM API 调用、Prompt 编写经验;
4. 熟悉至少一种评测框架(如 Inspect AI、OpenCompass、lm-eval-harness)者优先;
5. 具备良好的问题排查能力和文档习惯,工作细致、执行力强。