进入工作台 →

大模型/Agent 评测工程师(AI 研发方向)

🏢 美团📍 上海市/北京市
🎓 本科及以上 🧭 3年及以上 🎯 社招 来源:美团招聘
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

1. 负责通用 Agent、Code Agent 及 AI 研发工具的评测体系设计与建设,支撑模型、Prompt、工具和 Agent 工作流的持续迭代。 2. 深入需求分析、技术方案设计、代码生成与修改、测试生成、代码评审、缺陷修复和故障诊断等研发场景,将真实研发流程抽象为可复现、可扩展的评测任务。 3. 建立覆盖任务完成度、需求符合度、代码正确性、工具调用、规划执行、稳定性、安全性、成本和时延等维度的评测指标体系。 4. 负责评测数据和样本建设,持续沉淀真实任务、典型失败案例、线上反馈及核心回归用例,保障评测数据的代表性、区分度和可维护性。 5. 设计和研发自动化评测框架及平台,支持任务批量执行、过程数据采集、自动评分、版本对比、回归分析、异常告警和结果可视化。 6. 分析 Agent 的执行轨迹,定位其在需求理解、任务规划、上下文使用、工具调用、代码修改、测试执行和错误恢复等…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 职通车AI · 岗位数据受版权与反爬保护,禁止抓取与镜像