岗位描述(节选)
【岗位职责】
围绕大语言模型预训练,探索并构建前沿的大规模预训练数据处理管线;研究不同数据源的数据处理方法,将有效策略落地为可规模化运行的生产方案,最终通过预训练实验完成模型效果验证;岗位工作覆盖数据算法与数据工程两个方向,既关注数据处理方法本身,也关注方法在真实数据规模上的可靠落地。
工作职责:
1. 面向网页、代码、PDF/文档、多语言等不同类型的数据,研究数据构造、提取、解析、清洗、去重、质量评估、过滤和数据选择等方法。
2. 分析不同数据源的数据特征和质量问题,通过统计分析、数据抽样、错误案例及必要的实验评估处理效果。
3. 结合预训练模型的训练与评测结果,理解不同数据处理方式对模型效果的影响,并持续迭代数据方案。
4. 设计、开发和优化大规模预训练数据处理管线,关注数据正确性、处理效率、资源成本、稳定性和可复现性。
5. 根据实际问题持续完善相关的数据算法、处理工具和工程能力,并……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 19019 个北京岗位(全城各职能合计),其中 2814 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 7K ~ 20K(25~75 分位),中位约 9K,最低 2K、最高 300K。
在招岗位较多的企业:字节跳动 3923 个小米集团 1142 个快手 1017 个阿里巴巴集团(含高德/阿里云) 801 个美团 753 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。