岗位描述(节选)
负责千问APP相机场景的多模态算法能力建设,深入迭代VLM模型与Agent能力,你将负责多模态数据构建、VLM训练、数据飞轮和评测体系等关键工作,推动模型在图文对话、视觉RAG、多模态Agentic Search、视觉感知和推理等方向上的能力突破,持续提升用户在开放场景下的需求满足和体验上限。
【任职要求】
● 计算机科学、人工智能、数学等相关专业硕士及以上学历;
● 有扎实的大模型理论基础,熟悉业界前沿模型架构&技术;并且熟练掌握基本工具/主流框架的使用(如python/pytorch/swift/verl/megatron等);
● 具有VLM Post-Training、Agentic RL相关的理论功底和实践经验;
● 优秀的逻辑思维和创新意识,对技术充满热情,接受挑战&持续学习;
● 有相关领域顶会/顶刊论文者优先,包括但不限于 NeurIPS、ICML、ICLR、CVPR、I……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。