岗位描述(节选)
1、负责大模型智能体能力建设,负责智能体轨迹数据与RL训练环境体系搭建,分析真实用户场景与任务特性,提取典型任务流程与交互规则,设计构建可复现的容器化、沙箱化任务镜像,探索可验证任务数据生成与自动化评测方法,搭建贴近真实场景的智能体训练与执行环境;
2、深耕大模型智能体与强化学习前沿算法创新,跟踪复现LLM Agent与RL前沿技术,研究PPO、GRPO等算法在大规模语言模型中的应用,探索RL scaling、多任务强化学习、Agentic RL、长时序推理、多步规划、工具调用等核心能力,优化训练稳定性、样本效率与计算效率;
3、研发长程智能体核心能力,设计并优化智能体记忆与检索体系,搭建短期工作记忆与长期外部记忆的分层架构,研究记忆写入、更新、遗忘、冲突消解、上下文压缩等技术,结合RAG、Agentic Retrieval实现智能体主动知识检索,降低长交互Token开销,提升多轮对话状态……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。