岗位描述(节选)
【岗位职责】
搭建评测框架:构建针对RAG、Tool Calling、多步推理的自动化评测Pipeline,覆盖任务成功率与轨迹合理性。
裁判模型建设:落地LLM-as-a-Judge机制,解决打分偏差问题,实现Agent每日回归测试。
基准与数据集:维护业务评测黄金集,跟进行业Benchmark(如AgentBench),定期输出竞品对比报告。
缺陷归因:深度分析失败轨迹,区分是模型能力不足还是框架设计缺陷,推动底层优化。
【任职要求】
硬核技能:精通Python,熟悉Pytest,能独立搭建自动化测试工程。
懂大模型:熟悉RAG、Function Calling原理,擅长复杂Prompt设计与调优。
工程基础:熟悉Docker及CI/CD流水线,有数据分析(Pandas/可视化)能力。
加分项:有LLM-as-a-Judge实战经验;参与过AI应用的红队测试;熟悉LangChain或……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 22776 个上海岗位(全城各职能合计),其中 2348 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 8.4K ~ 20K(25~75 分位),中位约 12K,最低 0.8K、最高 120K。
在招岗位较多的企业:字节跳动 2640 个米哈游 644 个智元机器人 542 个蔚来 490 个得物 447 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。