岗位描述(节选)
1. 通过分析主流Benchmark及模型评测结果等方式,结合训练需求确定 RL 数据的能力覆盖范围与优先级;从多种渠道的海量数据里筛选挖掘样本并构建出清晰、可执行的问题描述,作为后续rollout数据生产的起点。
2. 针对 Coding 及 Work 等场景,以人机协作的方式设计并构建Agent的运行环境,以及可量化的 Verifier 或多维度打分 Rubric。需要保证环境和Judge的正确性、完整性、鲁棒性,且持续迭代以应对 Reward Hacking等各类挑战,确保评估信号与训练目标对齐。
3. 端到端搭建批量化的数据生产与验证 Pipeline,涵盖任务生成、轨迹采样、自动校验和质量过滤;构建 QA 框架,对rollout结果进行预校验与失败模式分析,保障进入训练的数据可信、可追溯。
4. 与领域专家和算法/训练等团队紧密配合,将模型效果反馈转化为数据策略调整(任务难度、R……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。