岗位描述(节选)
【团队使命】
通过高质量后训练数据与前沿算法,最大化释放Base模型潜能,打造兼具强大智能与深度意图理解力的AI模型。使得模型既能解决最难的问题,也能读懂每一个意图,更能作为自主Agent在复杂真实世界中可靠地行动。
【岗位类别】:实习/全职
【工作职责】
1.持续迭代与优化强化学习算法,在预训练模型与数据既定的条件下,最大限度地释放模型潜力。
2.跨部门团队紧密协作,构建高质量、高多样性的后训练数据集;设计并落地自动化数据清洗、评测及合成管线,系统性提升模型在写作、问答、Agent 等核心场景的表现。
3.建立科学、敏捷、多维度的模型能力评测体系,覆盖通用能力与 Agent 场景,精准定位模型短板并驱动针对性优化。
【岗位要求(满足其一即可)】
1.对大模型后训练有深入理解,熟悉 RLHF / RLVR / PPO / GRPO 等主流强化学习框架与范式,具备从算法设计到工程落地的完整经……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。