进入工作台 →

千问事业部-大模型自动化评测-北京/杭州

🏢 阿里巴巴集团(含高德/阿里云)📍 北京/杭州
🎓 本科 🧭 5年以上 🎯 社招 发布于 2026-09-17 来源:阿里巴巴招聘
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

核心职责:自动化评测集建设能力 1. 建设面向产品Agentic场景(Search Agent、Office Agent、对话Agent、生活服务Agent等)的端到端评测集,量化模型在真实产品链路中的表现,并拆解到模型原子能力,确保评测粒度可拆解至独立能力维度; 2. 基于评测数据产出结构化的模型能力诊断报告,明确优势与短板,形成可执行的优化建议,辅助算法团队确定模型迭代方向; 3. 持续追踪业界前沿Benchmark与评测方法论,保持评测集的先进性和行业对标能力; 【任职要求】 1. 有1年以上大语言模型评测、AI产品质量评估或相关领域工作经验优先 2. 深入理解大语言模型的能力边界与常见评测范式,具备独立设计完整评测方案的能力 3. 熟悉Agent/Agentic应用场景的评测方法,了解工具调用、多轮对话、任务规划等能力的评估要点 4. 优秀的逻辑思维和结构化表达能力,能将评测发现…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 求职者营地 · 岗位数据受版权与反爬保护,禁止抓取与镜像