岗位描述(节选)
岗位职责
1. 评测体系搭建 建立 AI Agent 端到端评测体系,制定覆盖问答质量、多轮对话一致性、工具调用准确率、任务完成率、稳定性、安全性与用户体验的多维评测标准,形成可量化、可复用的评分量表。
2. 评测数据集建设与管理 构建并持续维护高质量 Golden Dataset:完成样本采集、清洗、标注、分层、去重与版本管理;覆盖标准问答、多步推理、边界 Case 与对抗样本,保障数据集的代表性、场景覆盖度与区分度。
3. 自动化评测流水线与基建 开发自动化评测 Pipeline,融合规则校验、代码断言、LLM-as-a-Judge 与人工专家评审多路评分;接入 CI/CD 实现版本发布前自动回归;打通"离线评测 → 自动化回归 → 线上监控"全链路。
4. 竞品 Benchmark 对标 对标 Claude Code、OpenCode 等主流 Coding Agent 产品,定期开展……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。