岗位描述(节选)
【岗位职责】
为什么加入我们
1. 你会直接参与大模型训练前最核心的数据生产链路,数据质量、吞吐和覆盖度会影响模型能力上限。
2. 这里不是传统离线数仓,而是面向预训练数据构建的大规模分布式数据基础设施。
3. 你会在真实海量数据场景中使用 Spark 等分布式计算技术,解决解析、清洗、过滤、去重、质量评估和采样的工程问题。
【任职要求】
我们在做什么
MiniMax 正在建设面向大模型预训练的数据生产体系,支撑文本、音频、视频、多模态等数据从采集、解析、清洗、过滤、去重、质量评估到数据资产管理的完整链路
这不是普通的数据处理岗位,而是要把海量非结构化数据转化为可训练、可追踪、可评估、可持续供给的高质量预训练数据资产。你会深度参与预训练数据 Pipeline、分布式 计算平台和数据质量体系建设。
你将做什么
1. 设计并实现预训练数据 Pipeli……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 19019 个北京岗位(全城各职能合计),其中 2814 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 7K ~ 20K(25~75 分位),中位约 9K,最低 2K、最高 300K。
在招岗位较多的企业:字节跳动 3923 个小米集团 1142 个快手 1017 个阿里巴巴集团(含高德/阿里云) 801 个美团 753 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。