岗位描述(节选)
1. 设计智能体评测任务,覆盖工具调用、计算机操作、多智能体协作、长周期任务执行、事实准确性、指令遵循和复杂推理等方向;
2. 将抽象的模型行为问题转化为可验证的评测实验,完成假设定义、数据构建、模型运行、结果分析和迭代决策;
3. 研究模型行为的自动化探索方法,持续发现模型在复杂任务、长尾场景和真实业务流程中的能力边界与失败模式;
4. 建设可靠、可复现、可扩展的评测流水线,支持不同模型、模型版本、Prompt、智能体框架和工具配置的批量实验;
5. 建设持续评测与模型健康监控体系,包括:标准测试集和 Golden Dataset 建设、回归与性能漂移监控、模型版本对比、评测结果可视化、失败案例分析、自动化反馈和改进闭环;
6. 分析评测方法的可靠性、可扩展性、方差、统计显著性和评分一致性,持续提升评测结果的可信度;
7. 设计并维护评测相关的后端服务、数据管道和 API,将内部数据转换……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。