岗位描述(节选)
1. 评测体系驱动
● 将业务需求转化为可执行、可评测的Agent任务,明确能力边界、风险和验收标准。
● 建设离线与在线评测体系,包括任务分级、评测数据集、回归测试和真实轨迹分析;设计任务成功率、工具调用准确率、人工接管率、执行步数、延迟及Token成本等指标。
● 建立失败归因机制,区分模型、规划、工具、上下文和系统问题,驱动Prompt、Skill、模型及Harness持续优化。
2. 长程任务规划、决策与强化学习
● 负责多步骤、多工具、跨系统任务的拆解、规划、执行与验证,设计Planner–Executor–Verifier、任务图及动态Replan机制。
● 建设状态持久化、检查点、断点续跑、幂等执行和失败恢复能力,解决计划漂移、循环调用、上下文污染及长程任务信用分配问题。
● 构建Agent RL训练闭环,包括轨迹采集、环境回放、奖励设计和策略评估;熟悉SFT、DPO、GRP……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。