进入工作台 →

Dots-大模型能力评测师

🏢 小红书📍 北京市,上海市,杭州市
🎯 社招 发布于 2026-09-15 来源:小红书招聘
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

1、发现有价值的能力问题。 从用户需求、专业工作和生活场景中识别现有模型的能力缺口,将模糊的“体验不好”拆解为可研究、可验证的具体问题。 2、设计原创复杂任务。 围绕真实约束、信息不完整、多轮沟通、多模态理解和长流程协作等情境,构建有明确目标、合理难度及能力区分度的任务,避免单纯依赖冷知识或文字陷阱。 3、建设独立黑盒评测集。 参与任务采集、研究、编写、试测和迭代,核验资料与答案依据,维护样本质量、独立性及保密边界。 4、制定可执行的评分标准。 编写任务说明、参考答案或解题要点、分维度评分细则及边界案例;对没有唯一答案的问题,明确可接受范围与关键判断依据。 5、开展专家评审与一致性校准。 深入比较模型表现,识别看似流畅但缺乏事实、推理或实际价值的回答;组织案例讨论,分析分歧,提高评价的可解释性与可复现性。 6、开展 Agent 轨迹分析与失败归因。 阅读多轮对话、任务计划、工具调用参数与返…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 求职者营地 · 岗位数据受版权与反爬保护,禁止抓取与镜像