岗位描述(节选)
主导 Coding & Agent 方向评测体系的设计与落地实施,定义模型能力,设计评测方法并构建专业评测集。具体包括:
1. 主导设计并构建面向代码生成与智能体的评测基准,涵盖能力维度拆解、任务难度分级、数据集构造、评分标准制定等全流程,具备从 0 到 1 打造高区分度评测集的能力。
2. 持续跟踪学术界与工业界在代码智能(Code Intelligence)和 Agent 领域的前沿进展,提出评测方向演进策略的专业判断,确保评测体系能有效度量模型的真实能力边界。
3. 设计覆盖真实开发场景的代码评测任务,包括但不限于:代码补全、多文件编辑、调试修复、重构优化、仓库级理解、工具调用链路等,推动评测从"解题"向"工程实践"演进。
4. 设计面向复杂 Agent 场景的评测任务体系,涵盖多步推理、环境交互、工具编排、长程规划、错误恢复等维度,构建能反映真实 Agentic 工作流的端到端评测……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。