岗位描述(节选)
1. 负责大模型 Agent 系统的全流程评测工作,涵盖功能评测、性能评测、效果评测及稳定性评测,重点关注评测过程的稳定性保障与评测效率提升,搭建完善的评测体系与标准,确保 Agent 输出质量符合业务预期。
2. 设计并执行大模型 Agent 的评测方案,包括评测数据集构建、评测指标定义、评测流程规划,重点针对长程任务场景开展专项评测,熟悉 SWE Bench、Terminal Bench、GAIA 等主流 Agent 评测 benchmark,能基于 benchmark 完成评测落地、结果分析与优化,同时覆盖 Agent 的任务完成率、响应准确性、逻辑连贯性、工具调用合理性等核心维度评测。
3. 进行 Agent 运行轨迹分析与问题归因,梳理 Agent 在任务执行过程中的决策链路、工具调用流程、上下文交互等关键环节,定位输出异常、性能瓶颈、逻辑漏洞等问题,形成详细的归因报告并推动优化……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。