岗位描述(节选)
1. Agent Harness与长时任务
负责生产级 Agent Harness 核心算法与系统研发,包括上下文工程、工具调用、任务编排、状态持久化、权限控制、异常恢复和轨迹回放。
构建面向长时任务的分层记忆系统,包括工作记忆、情景记忆、语义记忆、经验记忆及长期 Artifact 管理。
重点突破 Long-horizon Planning 中的目标漂移、错误累积、上下文膨胀和决策不稳定问题。
2. Agent RL与后训练
负责 Agent RL 训练和策略优化,提升 Agent 在复杂工具调用、代码生成、多步推理及多模态创作任务中的成功率与鲁棒性。
构建长轨迹任务环境与 Benchmark,建立从任务生成、轨迹采集、结果验证到策略训练的完整闭环。
开展 SFT、Reward Modeling、DPO、PPO、GRPO等训练工作,结合成功与失败轨迹实现持续策略改进。
3. 多模态创……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。