岗位描述(节选)
工作职责:
1、负责结构化数据大模型指令微调(SFT)算法研究与系统实现,包括指令数据自动构造与筛选策略、灾难性遗忘缓解方法、以及模型在下游任务上的能力对齐与泛化提升;
2、负责统一架构下时序预测、表格分类、回归、异常检测等多任务联合学习框架的研究与实现,包括数据配比策略、梯度冲突缓解机制及跨任务知识迁移方案设计;
3、负责面向结构化数据场景的大模型AgenticRL训练算法研究与实现,覆盖Excel/CSV/多文件等办公数据分析,以及特征工程、机器学习建模等数据科学任务,提升模型的推理、规划、工具调用与自主任务完成能力;
4、研究大模型PPO/GRPO等强化学习及其改进方法,重点开展长程信用分配、过程监督与过程奖励、稀疏奖励下的探索学习、On-PolicyDistillation(OPD)等研究,解决多轮工具交互与长轨迹任务中的训练稳定性、探索效率和能力泛化问题;
5、负责智能体(Age……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。