岗位描述(节选)
1. 负责包括 SFT(监督微调)、Model Merge(模型合并)、OPD(在线/离线知识蒸馏)以及 RL(强化学习)在内的后训练算法研发与优化,探索更高效、更稳定的新型训练范式。
2. 提升大模型在Reasoning、General Agent 以及Coding Agent等专项任务上的上限,构建具备深度思考和自主行动能力的基座模型。
3. 模型架构探索与优化,探索更高效更有效的模型架构。
4. 训练与推理效率的优化,如算子优化、显存优化等,实现高吞吐、低延迟的模型研发和落地。
【任职要求】
1. 硕士及以上学历,计算机科学或相关专业背景。
2. 具备大模型研发经验,在 Post-Training(如SFT、RL、OPD等)某一方向上有实操积累。
3. 算法与工程兼备。熟悉数据与训练策略,也了解主流训练和推理框架(如 Megatron、SGLang、vLLM等)。
4. 具备极强的……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。