岗位描述(节选)
1. Reward / Rubric 设计:和领域专家一起把领域专业判断(漏洞是否成立、时序是否收敛、回答是否可用等)拆成可自动化验证的评分规则,覆盖硬验证(工具退出码 / 规则)+ 数值指标 + milestone + LLM judge 的多层组合;根据任务特性选择合适的奖励形态——dense reward(过程 / 分步奖励)、sparse reward(结果奖励)、process / outcome reward、reward shaping 与多目标加权,设计可训练、抗 hacking 的奖励信号。
2. RLVR / RLHF 训练落地与反查:用设计出的 reward / rubric 真实训练模型(SFT / GRPO / DPO / RLVR / RLHF),独立跑通训练闭环,从训练曲线与 benchmark 结果反查 reward 与数据的问题,形成"设计 → 训练 → ……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。