岗位描述(节选)
【岗位职责】
1. 全链路数据体系搭建:设计并实现大模型数据资产的知识体系,包括语料分类标准、知识图谱映射以及多维度的标签体系,构建可扩展的数据治理框架。
2. 语料精细化清洗:深度参与原始海量语料的清洗工作。利用 Python/Spark 等工具编写清洗脚本,处理噪音、去重、脱敏,并制定针对不同来源语料的清洗逻辑与质量标准。
3. 高质量数据池构建:负责通用语料与垂直行业语料的挖掘与整合,通过启发式规则、模型打分、聚类分析等手段,沉淀出亿级规模的“黄金语料库”。
4. 评测集与反馈闭环:构建科学的数据质量评测指标体系,通过模型反馈指导语料的进一步优化,形成“数据生产-评测-迭代”的良性循环。
5. 标注链路研发与提效:设计并优化 AI 辅助标注流程,开发辅助打标工具,在保证质量的前提下,极大提升人工标注的吞吐量。
【任职要求】
- 学历背景:计算机、数学或人工智能相关专业本科及以上学历……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 22857 个上海岗位(全城各职能合计),其中 2349 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 8.4K ~ 20K(25~75 分位),中位约 12K,最低 0.8K、最高 120K。
在招岗位较多的企业:字节跳动 2640 个米哈游 644 个智元机器人 542 个蔚来 490 个得物 447 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。