岗位描述(节选)
核心职责:自动化评测集建设能力
1. 建设面向产品Agentic场景(Search Agent、Office Agent、对话Agent、生活服务Agent等)的端到端评测集,量化模型在真实产品链路中的表现,并拆解到模型原子能力,确保评测粒度可拆解至独立能力维度;
2. 基于评测数据产出结构化的模型能力诊断报告,明确优势与短板,形成可执行的优化建议,辅助算法团队确定模型迭代方向;
3. 持续追踪业界前沿Benchmark与评测方法论,保持评测集的先进性和行业对标能力;
【任职要求】
1. 有1年以上大语言模型评测、AI产品质量评估或相关领域工作经验优先
2. 深入理解大语言模型的能力边界与常见评测范式,具备独立设计完整评测方案的能力
3. 熟悉Agent/Agentic应用场景的评测方法,了解工具调用、多轮对话、任务规划等能力的评估要点
4. 优秀的逻辑思维和结构化表达能力,能将评测发现……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。