岗位描述(节选)
1. 全模态数据流水线与架构建设:参与万亿级、EB级海量多模态数据(涵盖多语言文本、图像、音频、视频及 Agent 行为数据等)的采集、存储、清洗与加工。设计并实现高效率、高质量的全模态流程编排引擎及核心处理算子(Pipeline),保障海量异构数据的规模化流转与高扩展性。
2. 全模态数据自动化标注:能够结合深度学习与多模态大模型技术,研发并落地智能化的数据处理策略。利用算法模型进行跨模态特征提取与对齐、低质量噪声数据过滤、复杂场景下的异常数据拦截与高价值数据挖掘,大幅提升数据处理的自动化水平与数据质量。
3. 多模态数据对齐、评估与合成:主导大规模“图-文”、“视-文”、“音-文”等多模态对齐数据的规模化生产,尤其是在稀缺数据领域,探索并落地智能标注与前沿的数据合成(Data Synthesis)技术。与算法团队紧密合作,深度参与多模态大模型SFT及对齐阶段的高质量数据集构建、配比调优……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。