岗位描述(节选)
1、负责视觉大模型基座架构优化、视觉编码器CLIP性能优化和视觉编码器训练(图像编码器和视频编码器);
2、负责CLIP模型小型化优化,包含模型蒸馏效果优化、端侧轻量化模型架构设计、模型裁剪和稀疏训练(结构化稀疏和非结构化稀疏)、对比学习训练调优等;
3、参与视觉大模型实际训练和项目落地,主导高效视觉编码器的架构设计和端侧推理性能优化。
4、负责部分图文对数据集生产和构建、模型评测等任务
【任职要求】
1.硕士及以上学历,自动化、计算机等相关专业;
2.必须有视觉VIT基座优化经验或者VLM、VLA相关项目落地交付经验;
3.优秀的代码技术功底,熟练掌握CLIP编码器的From Scratch训练、VLM多模态预训练和强化学习训练等内容。
4.有VIT视觉基座模型的架构设计经验,能针对硬件特性设计高性价比的模型架构。
具备以下条件优先:
1.在NeurlPS/ICLR/ACL/EMNLP……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。