岗位描述(节选)
1、参与LLM大模型的数据准备、数据清洗、质量过滤及数据实验等工作,交付高质量训练数据;
2、参与建设对标业内前沿的LLM训练数据集,并在此基础上持续迭代,进一步提升数据质量和多样性;
3、参与构建和维护高性能LLM数据处理Pipeline,优化链路成本,提升性能和稳定性;
4、与算法同学协作,参与大模型训练数据的质量分析、评估体系建设和数据迭代,推动模型效果提升。
【任职要求】
1、计算机/软件工程等相关专业本科以上学历,拥有LLM相关专业硕士/博士学位者优先;
2、熟悉常见数据处理流程,拥有大模型数据处理与合成经验,有一线互联网大模型数据处理实习经历者优先;
3、熟悉Python,了解大模型训练和推理框架(PyTorch、vLLM、SGLang等),了解分布式数据处理框架(Spark/PySpark、Ray等),具备数据任务开发调试能力;
4、具备优秀的分析和解决问题能力,良好的团队……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。