岗位描述(节选)
1. 负责全网高价值互联网数据源发现和识别筛选,涵盖网页、PDF、音视频等多模态来源,分析数据天花板,评估数据价值和优先级,支持医疗、金融、大模型和智能应用等核心领域数据全面覆盖;
2. 负责全网数据采集相关链接和网页特征算子研发和水位提升,持续优化提升数据任务和系统能力水位,充分支持模型训练、RAG搜索等数据需求;
3. 持续提升技术竞争力,在数据覆盖、数据时效、下载渲染成功率、死链监测、采集成本方面做到行业领先水位;
4. 帮助提升团队算法能力,进行技术分享和人才培养,指导领域新同学和研究实习生工作。
【任职要求】
1. 计算机、人工智能、大数据或者相关专业本科及以上学历,3年以上大规模数据采集、处理、搜索推荐等相关领域经验;
2. 熟悉文本分类、聚类、NER等NLP及相关领域的机器学习算法,能设计数据价值评估、优先级排序的落地方案;有大模型训练数据构建、RAG数据链路经验优先;
3……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。