岗位描述(节选)
工作职责:
1、端到端数据流水线设计:负责设计、构建与优化面向大模型训练的超大规模多模态数据端到端处理流水线,覆盖数据获取、清洗、标注、质量验证到最终训练集生成的全过程。
2、高性能数据算子库开发:抽象和封装多模态数据(文本、图像、视频、音频)的通用处理逻辑,设计并实现高性能、可复用的数据算子库。
3、训练数据Dataloader研发:深入跟进模型训练阶段,基于处理好的高质量数据集,研发与优化与PyTorch等训练框架无缝集成的高性Dataloader,确保训练过程中数据读取与加载的效率,解决I/O瓶颈,极大提升GPU利用率。
4、流水线编排与效率提升:研发灵活的配置化流水线引擎,支持原子算子的快速编排,并持续优化全链路的数据处理速度和资源效率,快速响应算法团队的数据需求。
5、质量与评估体系:建立数据质量监控与评估体系,确保输出数据集的洁净度、一致性与有效性,并能量化数据质量对最终模型效……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 9394 个上海岗位(全城各职能合计),其中 1138 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 7.5K ~ 20K(25~75 分位),中位约 12K,最低 0.8K、最高 100K。
在招岗位较多的企业:米哈游 618 个哔哩哔哩股份有限公司 432 个闻泰科技股份有限公司 409 个联影医疗 361 个阿里巴巴集团(含高德/阿里云) 319 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。