岗位描述(节选)
1.多模态数据体系构建:设计并实现 VLM 预训练数据的采集、清洗、标注全流程方案,涵盖通用图文对、OCR 数据、Visual Grounding/Counting 数据、3D 空间理解数据及视频时序数据等多类型数据,建立数据质量评估体系(如 CLIP 相似度过滤、标注一致性校验)。;
2.数据算法创新设计:研发多模态数据对齐算法,优化视觉 - 语言模态映射策略;设计高效数据增强方案,包括图像形变、文本扰动、跨模态混合增强等,提升模型鲁棒性与场景适应性;探索自动标注与数据合成技术(如 Grounding DINO 自动框标注、LLM 辅助问答生成),降低标注成本。;
3.预训练数据策略优化:结合 VLM 预训练目标(模态对齐、上下文学习、复杂推理),设计数据配比方案与训练数据筛选策略;迭代优化数据配方,解决数据冗余、分布偏差等问题,提升训练效率与模型效果。;
4.工程化落地与协……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。