岗位描述(节选)
1. 大规模高质量数据体系与合成数据建设
数据体系构建: 建设 Trillion 级别的大规模跨模态数据处理与合成链路。负责从数据清洗、去重、质量评分到动态配比建模的全流程优化。
合成方法演进: 深入探索大规模合成数据 (Synthetic Data) 与自蒸馏 (Self-distillation) 技术,针对复杂逻辑推理、代码生成及多模态场景,制定Pre-training与 Mid-training 阶段的合成数据应用策略。
理论探索: 研究 Data Scaling Laws,解决数据扩展中的模型坍塌(Model Collapse)与多样性瓶颈问题,通过课程学习(Curriculum Learning)等多阶段训练策略,显著优化 Token/FLOPs 转化效率。
2. 长上下文 (Long Context) 与高效架构演进
长窗口突破:持续 Scaling Up 模型的 ……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。