进入工作台 →

飞猪-大模型算法专家-RL 环境合成

🏢 阿里巴巴集团(含高德/阿里云)📍 杭州
🎓 硕士 🧭 3年以上 🎯 社招 发布于 2026-09-17 来源:阿里巴巴招聘
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

结合旅行、大消费领域域需求,研发面向大模型智能体强化学习(Agentic RL)的训练任务与环境合成方法,设计任务验证与奖励机制,提升模型在旅行大消费领域、工具使用和复杂任务中的执行能力。 岗位职责 1. 训练任务与环境合成 根据模型能力目标和评测结果,确定训练任务的覆盖范围与难度分布。围绕行程规划、交通住宿选择、多约束决策等旅行场景,设计任务目标、初始状态、可用工具及环境反馈,研究任务与环境的自动合成方法,提升任务的可解性、多样性和训练价值。 2. 验证算法与奖励设计 将任务完成条件和质量要求转化为可执行的验证器(Verifier)与评分标准(Rubric),覆盖信息准确性、时间与预算约束、方案完整性及可执行性等维度。结合程序测试、环境状态检查、模型评判及智能体主动核验,设计结果与过程奖励,分析验证误判、评分偏差和奖励漏洞。 3. 交互数据生成与质量优化 研究 Age…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 求职者营地 · 岗位数据受版权与反爬保护,禁止抓取与镜像