进入工作台 →

数据技术及产品部-RL Data Rubric 算法设计专家-Work

🏢 阿里巴巴控股集团📍 北京/杭州
🎓 本科 🧭 2年以上 🎯 社招 发布于 2026-09-11 来源:阿里巴巴招聘
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

1. Reward / Rubric 设计:和领域专家一起把领域专业判断(漏洞是否成立、时序是否收敛、回答是否可用等)拆成可自动化验证的评分规则,覆盖硬验证(工具退出码 / 规则)+ 数值指标 + milestone + LLM judge 的多层组合;根据任务特性选择合适的奖励形态——dense reward(过程 / 分步奖励)、sparse reward(结果奖励)、process / outcome reward、reward shaping 与多目标加权,设计可训练、抗 hacking 的奖励信号。 2. RLVR / RLHF 训练落地与反查:用设计出的 reward / rubric 真实训练模型(SFT / GRPO / DPO / RLVR / RLHF),独立跑通训练闭环,从训练曲线与 benchmark 结果反查 reward 与数据的问题,形成"设计 → 训练 → …… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 职通车AI · 岗位数据受版权与反爬保护,禁止抓取与镜像