岗位描述(节选)
1. 负责全网高价值互联网数据源发现,涵盖网页、PDF、音视频等多模态来源,分析评估数据天花板,支持金融等核心领域数据全面覆盖;
2. 负责全网数据采集相关系统架构设计和开发工作,持续优化提升数据任务和系统能力水位,充分支持模型训练、RAG搜索等数据需求;
3. 持续提升技术竞争力,在数据覆盖、数据时效、下载渲染成功率、采集成本方面做到行业领先水位;
4. 保障系统稳定性,预判并解决系统潜在技术风险,持续降低技术负债。
【任职要求】
1. 精通数据采集/网络爬虫领域,具备解决全网爬虫核心问题实战经验,3年以上大型互联网公司开发经验;
2. 熟练掌握Java/Python/Go当中至少一种编程语言,具备主导复杂系统架构设计能力;
3. 熟悉分布式架构和并发编程,熟悉业界主流大数据计算存储引擎Spark/Flink/MaxCompute等,具有数据密集型应用开发经验;
4. 有运用LLM能力……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。