岗位描述(节选)
参与大语言模型的核心技术研发,包括但不限于:
1、预训练优化(数据合成、长上下文建模、训练动态分析);
2、后训练技术(强化学习、奖励模型、推理能力提升);
3、代码生成与理解(自动化数据构建、运行反馈优化);
4、模型架构创新(MoE、高效推理、稳定性优化);
5、探索AI Agent、长序列推理、在线学习等新兴方向。
熟悉大语言模型(如Transformer、MoE)的核心原理,具备以下至少一项经验:
1、大规模模型训练(分布式训练、数据优化);
2、强化学习、奖励建模或AI Agent开发;
3、代码生成、程序理解或相关领域;
4、模型架构优化(如高效推理、长上下文处理);
5、熟练使用PyTorch、DeepSpeed等框架,具备代码实现与调试能力。