岗位描述(节选)
1、负责LLM、VLM、搜索推荐等大模型日常评测工作和评测体系建设,包括但不限于设计制定和完善评测方案、评测指标、评测数据收集和更新、评测执行,并输出专业评测报告,深度参与算法效果分析、挖掘问题归因;
2、以算法手段,对基座大模型、应用大模型以及AI产品进行分阶段、端到端效果评测,持续跟踪行业前沿发展,并进行竞品对比;
3、从可解释性角度探索提出更多更深入的基于模型内在机理的评测基准以及评测框架,包括通用能力、智能应用,如Agent、OpenClaw、CoWork等;
4、探索智能、高效的模型自动化评估方案,参与自动化评测工具设计、开发及维护;
5、提出更好的Benchmark,定义模型能力,定义AGI,并在相关会议或期刊发表;
6、站在用户角度,对产品、算法提出建设性的意见,在评测参与的各个流程中以用户视角保证产品体验。
【任职要求】
1、硕士及以上学历,计算机、通信、人工智能、大数据……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 11029 个北京岗位(全城各职能合计),其中 2386 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 5.5K ~ 16K(25~75 分位),中位约 9K,最低 2K、最高 300K。
在招岗位较多的企业:美团 1313 个快手 1014 个阿里巴巴集团(含高德/阿里云) 797 个理想汽车 498 个京东 336 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。