进入工作台 →

LLM Pretrain Data研究员

🏢 米哈游📍 上海/北京
🎯 社招 来源:米哈游招聘
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

1、针对多种数据源(包括GitHub代码库、网页爬取的code以及通用文本数据)设计并实现代码及通用数据清洗pipeline。 2、开发并迭代基于LLM的数据过滤策略,以提高预训练语料库的数据质量。 3、开发、维护并优化数据pipeline,确保其在大规模场景下的性能和可靠性。 【任职要求】 1、精通大规模数据处理框架,如Apache Spark或Ray。 2、扎实的Python编程能力,熟悉分布式计算。 3、数据sense强,能够分析并处理不同代码和文本语料中的边界情况。 【加分项】 1、具有预训练数据处理pipeline的经验,特别是code数据方面。 2、具备vLLM或SGLang等LLM推理框架的实际使用经验。
© 2026 求职者营地 · 岗位数据受版权与反爬保护,禁止抓取与镜像