岗位描述(节选)
【团队使命】
预训练数据开采自人类世界全部已有知识所沉积的富矿,是驱动模型强大能力的核心燃料。
预训练数据团队围绕大模型预训练,构建了从数据采集、清洗处理到底层基础设施的完整数据体系,持续为模型训练输送高质量、规模化、多模态的数据燃料,不断拓展模型的世界知识边界。
如何寻找蒙尘的富矿,并淘洗炼制成可用的智能燃料,是一门极难的硬功夫。我们以亿万数据筑就模型智能的坚实底座,更要用普惠的方式,把这份属于全人类的财富,重新还给全人类。
招聘方向
【实习/全职】
:
数据采集 pipeline 方向、语言数据处理方向、多模态数据方向、数据基建方向。
数据采集 pipeline 方向
【岗位职责】
1.全网数据选取策略设计开发
(1)根据数据清洗反馈信号设计全网数据选取、调度系统,包括链接质量预估、属性聚合、站点抓取配额、数据优先级等,保证数据多样性,最大化数据覆盖,为模型训练提供丰富的世界知识。
(……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。