岗位描述(节选)
1、作为训练数据交付的 owner,承接预训练/后训练/RL 各阶段的数据需求,将模型数据策略落地为可执行的数据规格(数据源、处理策略、质量标准、量级与时效),端到端构建并交付训练就绪数据集;
2、研发与应用视频数据核心算子:多维质量过滤(清晰度/美学/构图/运动性)、镜头切分、大规模语义去重、水印字幕检测、Caption/Recaption 链路,并建立算子效果评估基线;
3、基于数据平台将算子编排为自动化数据管线,落实数据与处理算子版本化,让每一批交付数据可追溯、可复现;
4、探索基于 MLLM 的数据合成与增强技术,设计高效生成策略补充数据缺口;建设多样性覆盖度度量(主体/场景/动作/风格/运镜)与分布再平衡、训练配比实验;
5、建设数据↔模型的归因与消融实验能力,结合评测反馈持续迭代数据策略与交付质量,与模型算法、数据平台、数据产品高效协同。
【任职要求】
1、计算机、人工智能、……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。