岗位描述(节选)
AI 搜索场景下的大模型后训练与效果优化。
职位描述
1、负责 AI 搜索场景大模型的后训练与效果优化,提升模型在内容理解、复杂推理、答案生成及工具使用等方面的能力。
2、建设 AI 搜索大模型的数据、评测与奖励体系,包括高质量 SFT 数据构造、偏好数据生产、自动与人工评测、Query-specific Rubric 设计及 Reward Model 训练。
3、探索并落地 SFT、DPO、PPO/GRPO、Rubric RL、Agentic RL 等后训练方法,持续优化模型的指令遵循、事实准确性、推理能力、搜索决策与结果生成质量。
4、面向 LLM Search、GenSearch、RAG 和 Agentic Search 等场景,优化工具调用、自我反思和动态决策等关键能力。
5、协同搜索算法、产品、数据与工程团队推进模型上线,确保模型在实际业务中的效果、稳定性、时延与成本,并建立……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。