岗位描述(节选)
1、多模态大模型训练:参与视觉语言模型(VLM)在电商内容场景的持续预训练、SFT 与强化学习(RLHF / GRPO / DPO),提升模型在内容质量评估和细粒度语义理解上的表现。
2、内容理解 Agent 系统:设计并落地面向内容标签理解的 Agent 系统,包括任务规划、工具调用、多轮推理与自我校验链路,解决单次推理难以覆盖的复杂判定场景。
3、Agent 强化学习:构建可扩展的评测集与奖励模型(Reward Model),通过在线 / 离线强化学习持续优化 Agent 的决策准确率与稳定性。
4、业务落地:与产品、运营、工程团队协同,将模型能力沉淀为线上服务,支持质量和语义标签识别,并持续跟踪其在下游推荐场景的实际收益。
【任职要求】
1、计算机、人工智能、机器学习、自然语言处理等相关专业硕士及以上学历;
2、扎实的深度学习基础,熟悉 Transformer / 多模态大模型架构……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。