岗位描述(节选)
岗位职责
:
1. 主导视觉生成模型全链路数据体系建设,制定数据采集、清洗、标注、配文及多模态对齐的策略与规范,构建大规模、高质量的训练数据集。
2. 负责专用领域数据的定向收集、合成与优化:针对业务场景(如虚拟试穿、数字人驱动)构建精细化数据Pipeline,利用合成数据生成技术解决长尾与稀缺样本问题,建立数据质量评估与模型训练反馈的迭代闭环。
3. 构建自动化数据流水线,包括视频去重、镜头切分、文本-视频对齐等预处理环节,提升数据生产效率
4. 配合完成数据版本的效果验证,分析bad case中的数据归因,迭代优化数据配比与质量策略
任职要求:
1. 计算机电子/图像处理/光学专业优先,硕士及以上学历,计算机视觉/机器学习方向,3年以上生成模型研究或一线大厂核心项目经验;
2. 精通PyTorch与分布式训练框架,掌握主流训练库,有大规模图文、视频数据训练与工程化落地实战……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。