岗位描述(节选)
工作内容
1. Agent 后训练全流程建设: 负责基于大语言模型的通用 Agent 的后训练(Post-training)工作,覆盖 SFT、偏好对齐(DPO/ORPO/KTO 等)、RLHF/RLAIF、RLVR 等阶段,针对 Tool-use、多轮规划、长程推理、错误恢复等核心能力进行定向训练;
2. Agentic SFT 数据工程: 构建高质量 Agent 轨迹数据生产线,包括真实交互轨迹采集、模型自博弈(Self-play)生成、轨迹筛选与清洗、拒绝采样(Rejection Sampling)、多样性增强等策略,持续迭代数据配方与课程学习方案;
3. Preference & Reward Modeling: 训练面向 Agent 行为的 Reward Model / Preference Model,覆盖任务完成率、工具调用正确性、推理链质量、步骤效率、安全性等多维信号;探……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。