岗位描述(节选)
1.主导智能文档处理清洗链路建设,支持多源多格式的文档如PDF文档解析、结构化信息抽取、纠错处理等。
2.研究和应用先进的文档解析技术,例如 OCR、文本分析、信息抽取、自然语言处理等。 开发和优化文档解析算法和模型,提高解析精度和效率。
3.结合多模态大模型对文档分析和理解中涉及到的版面分析、表格理解、结构化信息抽取等核心课题进行深入探究。
【任职要求】
1.三年以上产品/项目研发经验,对多源异构文档有深刻的理解,对文档解析策略具有丰富的工程经验。熟练掌握常见数据结构和算法,能够解决复杂的字符串处理、模式匹配和优化问题。
2.熟悉主流OCR引擎(如 Tesseract, PaddleOCR, Google Vision AI, AWS Textract)的原理、应用和调优。熟悉图像预处理技术,如二值化、去噪等。
3.具备NLP相关技术背景和实际开发能力,能够使用规则、机器学习或深度学习……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。