岗位描述(节选)
1. 负责垂类大模型后训练(Post-training)阶段的算法研发工作。
2. 设计并优化高质量的指令数据微调(SFT)与对齐(Alignment)工作,构建针对如金融事实性、合规性及逻辑推理的 Reward 模型系统,激发模型的专业对话、复杂逻辑推理及合规风控能力。
3. 构建基于 Agentic-RL 的金融数据仿真环境及 API 对接体系,通过合成高质量多轮决策轨迹,打造具备极致专业性与安全性的垂类行业模型。
【任职要求】
● 计算机科学、人工智能或相关专业背景,具备大模型后训练实战经验。
● 精通 SFT、RLHF(PPO/DPO/GRPO)及对齐算法,具备构建复杂奖励模型(Reward Model)的实战经验。
● 理解Agentic技术栈,有仿真环境构建、工具调用(Tool Use)及多轮决策轨迹合成的相关研发经验。
● 具备扎实的算法工程实现能力,熟悉 PyTorch、……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。