岗位描述(节选)
【岗位职责】
1、主导大模型数据生产的Pipeline建设,涵盖寻源、采集、解析、处理、实验与分析等环节,为各基础模型提供稳定、大规模且高质量的预训练数据;
2、进行前沿数据合成研究,探索基于LLM的数据合成与增强技术(如Self-Instruct、Agent交互模拟等),设计高效生成策略以补充数据缺口;
3、建立针对合成数据的自动化评估体系(如Reward Model、LLM-as-a-Judge),并结合模型评测与数据分析反馈,反向迭代生产线与数据生成策略;
4、搭建并优化大模型预训练的数据工程底座,开发自动化框架与平台,支持海量数据的清洗、去重与格式化处理,提升底层资源调度与数据策略迭代效率;
5、沉淀全网高质量预训练数据,建设端到端的数据质量、多样性体系及场景化标签,与算法及基建团队高效协同,探索真实与合成数据的最优配比。
【任职要求】
1、本科及以上学历,计算机、人工智能、数学……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 2772 个上海技术研发岗位,其中 302 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 15K ~ 26K(25~75 分位),中位约 20K,最低 4K、最高 100K。
在招岗位较多的企业:字节跳动 361 个拼多多 179 个米哈游 161 个哈啰出行 141 个阿里巴巴集团(含高德/阿里云) 110 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。