岗位描述(节选)
结合旅行、大消费领域域需求,研发面向大模型智能体强化学习(Agentic RL)的训练任务与环境合成方法,设计任务验证与奖励机制,提升模型在旅行大消费领域、工具使用和复杂任务中的执行能力。
岗位职责
1. 训练任务与环境合成
根据模型能力目标和评测结果,确定训练任务的覆盖范围与难度分布。围绕行程规划、交通住宿选择、多约束决策等旅行场景,设计任务目标、初始状态、可用工具及环境反馈,研究任务与环境的自动合成方法,提升任务的可解性、多样性和训练价值。
2. 验证算法与奖励设计
将任务完成条件和质量要求转化为可执行的验证器(Verifier)与评分标准(Rubric),覆盖信息准确性、时间与预算约束、方案完整性及可执行性等维度。结合程序测试、环境状态检查、模型评判及智能体主动核验,设计结果与过程奖励,分析验证误判、评分偏差和奖励漏洞。
3. 交互数据生成与质量优化
研究 Age……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。