岗位描述(节选)
大数据工程部定位于为基座模型及业务提供高质量数据与 AI 化解决方案。我们以数据为核心,通过数据工程与模型算法相结合的方式,加速大模型在数据、实验与评测环节的迭代效率,持续沉淀高价值数据资产,支撑模型与应用的演进。在具体实践中,我们面向多语言、多模态大模型训练,开展数据清洗、去重、打标等关键算法与方法建设,并系统性构建预训练与后训练数据管道,从质量、覆盖度与多样性等维度提升数据整体水平,持续助力模型效果提升。同时,我们积极探索合成数据、数据规模扩展规律、多模态数据对齐等前沿数据方向,将数据侧的创新转化为可验证、可复用的模型收益。
1.负责多语言、多模态大模型训练所需的数据清洗、质检、去重、理解等算法开发,通过构建完整的数据体系,为大模型的训练数据质量负责;
2.负责大模型预训练数据管道建设系统性方法研究,通过质量/覆盖/多样性等方法构建高质量预训练、后训练数据,提升基座模型训练效果;
3……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。