进入工作台 →

Token Foundry-基础大模型 Post-Training 算法专家-杭州/北京

🏢 阿里巴巴集团(含高德/阿里云)📍 北京/杭州
🎓 硕士 🧭 1年以上 🎯 社招 发布于 2026-08-24 来源:阿里巴巴招聘
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

1. 负责大模型 Post-Training 全链路算法建设,覆盖 Pre-SFT、SFT、RLHF、RLVR(PPO / DPO / GRPO 等)各阶段的算法调优与策略设计,提升模型在指令遵循、工具调用、安全合规、多轮交互、long horizon task 等核心维度的综合能力。 2. 负责 Reward Model 的设计、训练与迭代优化,构建 Verifier、LLM as Judge、Rule 等多元 Reward System,优化多维度(安全性、准确性、有用性、逻辑性、拟人度等)的偏好数据采集策略与训练方案。 3. 设计高质量 SFT / RL 数据采集、清洗与标注方案,建立数据质量评估标准;通过实验驱动数据配比方法论,探索高质量数据合成、Agentic RL 等前沿方法,持续提升数据质量与多样性。 4. 参与模型合版工作,包括数据配比策略、多任务训练优化、灾难性遗忘缓解等…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 求职者营地 · 岗位数据受版权与反爬保护,禁止抓取与镜像