岗位描述(节选)
1. 负责百炼平台后训练技术架构设计与性能优化,建设 LLM/MLLM 及 AIGC (DiT) 场景的生产级微调与对齐能力。
2. 负责十亿至万亿级参数模型分布式训练的工程落地,定位计算、显存、通信与系统瓶颈,提升 MFU 并降低训练成本。
3. 主导数据管线(数据合成、效果评测、数据回流)与高鲁棒 Rubric/Reward 体系的架构设计与开发,牵引模型持续迭代。
4. 负责分布式训练容错及弹性架构,优化端到端后训练性能与稳定性,保障生产级 SLA。
【任职要求】
1. 计算机、人工智能相关专业硕士及以上学历,精通 Python/C++/Rust 等至少一种编程语言,具备扎实的系统架构设计能力。
2. 深入理解深度学习框架(PyTorch/DeepSpeed 等);具备大规模 GPU 集群训练排错(如网络死锁、显存 OOM、容灾恢复)与性能调优经验。
3. 熟悉 LLM/MLLM ……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。