岗位描述(节选)
1、遵循robots协议,采集互联网上允许搜索爬虫采集的公开非敏感信息,满足大模型、商业化等核心业务数据需求;
2、负责分布式采集系统的建设与迭代优化,负责数据调度、采集、数据结构化、持久化全链路核心流程迭代升级;
3、帮助团队攻克各种采集技术难关,提升系统的采集效果与效率。
【任职要求】
1、本科及以上学历,计算机相关专业,有强烈的好奇心和技术敏锐度,对AI大模型和采集相关技术有浓厚的兴趣;
2、熟悉Java、Python等语言,具备扎实的编码能力;熟悉主流采集技术及框架工具,如Frida、Puppeteer、Scrapy等;
3、熟悉常见互联网风控策略,并具备相关的实战经验;
4、加分项:App逆向、反混淆、脱壳、算法与多模态内容理解。