进入工作台 →

agent后训练算法实习生-2027届

🏢 小米集团📍 北京
🎓 计算机、人工智能、数学、统计等相关专业在读硕士/博士(优秀本科生亦可) 🧭 应届/无经验要求 🎯 社招 发布于 2026-09-21 来源:小米集团招聘
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

工作内容 1. Agent 后训练全流程建设: 负责基于大语言模型的通用 Agent 的后训练(Post-training)工作,覆盖 SFT、偏好对齐(DPO/ORPO/KTO 等)、RLHF/RLAIF、RLVR 等阶段,针对 Tool-use、多轮规划、长程推理、错误恢复等核心能力进行定向训练; 2. Agentic SFT 数据工程: 构建高质量 Agent 轨迹数据生产线,包括真实交互轨迹采集、模型自博弈(Self-play)生成、轨迹筛选与清洗、拒绝采样(Rejection Sampling)、多样性增强等策略,持续迭代数据配方与课程学习方案; 3. Preference & Reward Modeling: 训练面向 Agent 行为的 Reward Model / Preference Model,覆盖任务完成率、工具调用正确性、推理链质量、步骤效率、安全性等多维信号;探…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 求职者营地 · 岗位数据受版权与反爬保护,禁止抓取与镜像