岗位描述(节选)
1. 评测体系建设:面向大模型、智能体及多智能体协作场景,设计客观、可量化的评测方案,建立覆盖任务完成质量、推理规划、工具调用、稳定性、执行效率与成本等维度的评价标准;
2. 评测数据与基准建设:结合真实业务需求,构建具有代表性和区分度的评测任务、数据集及运行环境;制定标注规范和评分标准,持续积累典型问题、复杂任务与边界案例,完善评测覆盖;
3. 自动化评测方法研发:结合规则校验、可执行验证、模型评分与人工评价,研发适用于不同任务的评测方法;探索大模型作为评判器(LLM-as-a-Judge)的应用,校准评价偏差,提升评测准确性、一致性和效率;
4. 效果分析与优化反馈:深入分析评测结果和智能体执行过程,定位模型能力、任务规划、工具使用及协作环节中的问题,形成清晰的评测报告与改进建议,并与算法、产品及工程团队协作验证优化效果;
5. 评测工具与流程建设:参与评测平台和自动化流程建设,支持批……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。