岗位描述(节选)
【岗位职责】
1、负责大模型评测体系建设:负责将业界SOTA大模型(含多模态大模型)部署到内部评测环境,基于多领域评测集完成规模化跑测,验证并校准模型评估指标,保障评测流程的准确性与可复现性;
2、开源评测集适配与集成:调研并引入业界主流开源评测集(覆盖文本、多模态与Agent三类,以多模态与Agent评测为主),将其适配、接入到内部模型评测体系,统一评测指标口径与执行流程,保障评测的覆盖度、针对性与可复现性;
3、Agent能力评测:针对Agent Based Bench开展评测,支持多轮交互、工具调用、Sandbox环境与轨迹记录,分析任务完成情况与失败原因,评估模型的Agent能力边界;
4、评测结果自动化分析:设计算法与工具,实现评测结果的自动化量化分析、异常定位及根因追溯,输出结构化分析报告,为模型选型与迭代提供数据支撑;
5、Agent RL环境与推理优化(可成长方向):探索面……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 19019 个北京岗位(全城各职能合计),其中 2814 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 7K ~ 20K(25~75 分位),中位约 9K,最低 2K、最高 300K。
在招岗位较多的企业:字节跳动 3923 个小米集团 1142 个快手 1017 个阿里巴巴集团(含高德/阿里云) 801 个美团 753 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。