岗位描述(节选)
1. 负责大模型训练数据资产的质量评估与分析建设,围绕文本、多模态等数据建立清洗、去重、完整性校验、质量分级等能力,提升数据可用性与训练收益。
2. 负责数据资产标签体系、分类分级体系及质量评估模型建设,支持数据资产的盘点、洞察、管理与复用。
3. 基于向量检索、语义匹配、聚类分析等技术,建设数据资产的语义索引、检索发现与相似性分析能力。
4. 跟踪国内外前沿开源数据集、学术数据集及竞品数据建设方向,结合模型能力发展判断外部数据价值,输出数据资产地图与储备建议。
5. 与训练、评测、工程、平台、情报、领域专家等团队紧密协作,持续优化数据评估算法与资产管理体系,形成“模型反馈 → 数据洞察 → 资产优化 → 能力提升”的正向飞轮。
【任职要求】
1. 计算机、人工智能、数学、统计学等相关专业,硕士及以上学历。
2. 熟悉机器学习、深度学习及主流大模型技术体系,具备大模型预训练、SFT、RL……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。