岗位描述(节选)
1、分布式采集系统架构:设计并搭建支撑千亿级网页规模的分布式爬虫系统,覆盖任务调度、抓取执行、资源管理全链路,保障系统的高可用与横向扩展能力。
2、抓取调度与优先级策略:构建智能化 URL 调度系统,结合时效性、重要性、更新频率等维度动态调整抓取优先级,提升关键页面的抓取时效与覆盖率。
3、动态渲染与页面获取:研发/维护无头浏览器(Headless Browser)渲染集群,解决 JS 动态加载、异步渲染页面的抓取问题,优化渲染资源消耗与并发吞吐。
4、存储与去重基建:设计高性能网页存储、URL 去重(Bloom Filter/布隆过滤器、指纹库)、增量更新机制,支撑索引库的低冗余高质量存储。
5、性能与稳定性优化:持续优化采集系统的吞吐量(QPS)、资源利用率与容错能力,建立完善的监控告警体系,保障系统 SLA。
6、与算法团队协同:对接网页解析、页面质量评估、知识抽取等算法模块,打通"……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。