岗位描述(节选)
1、发现有价值的能力问题。 从用户需求、专业工作和生活场景中识别现有模型的能力缺口,将模糊的“体验不好”拆解为可研究、可验证的具体问题。
2、设计原创复杂任务。 围绕真实约束、信息不完整、多轮沟通、多模态理解和长流程协作等情境,构建有明确目标、合理难度及能力区分度的任务,避免单纯依赖冷知识或文字陷阱。
3、建设独立黑盒评测集。 参与任务采集、研究、编写、试测和迭代,核验资料与答案依据,维护样本质量、独立性及保密边界。
4、制定可执行的评分标准。 编写任务说明、参考答案或解题要点、分维度评分细则及边界案例;对没有唯一答案的问题,明确可接受范围与关键判断依据。
5、开展专家评审与一致性校准。 深入比较模型表现,识别看似流畅但缺乏事实、推理或实际价值的回答;组织案例讨论,分析分歧,提高评价的可解释性与可复现性。
6、开展 Agent 轨迹分析与失败归因。 阅读多轮对话、任务计划、工具调用参数与返……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。