岗位描述(节选)
面向业务场景,围绕大模型应用的效果质量开展设计、评测与迭代,打通「应用—反馈—数据—迭代」的闭环。具体职责包括以下方向的一项或多项:
1. 需求转译
与产品、业务共创,将业务诉求转化为可评估的 AI 任务,明确目标、指标与验收口径。
2. 方案选型
在 Prompt、检索(RAG)、上下文工程、轻量微调等路线之间进行技术选型与权衡,并完成方案落地。
3. 评测体系
设计评测指标与 Rubric,搭建离线评测集与自动评测(LLM-as-judge 与人工评审),建立线上 A/B 实验,监控指标漂移。
4. 归因与调优
定位效果问题的来源(检索、Prompt、上下文或模型),推进可验证的改进。
5. 数据建设
构造评测集与训练数据,建立数据版本与质量追踪。
6. 上线与运营
负责系统集成与发布,对线上效果、稳定性与成本负责。
【任职要求】
1. 计算机 / 数学 / 统计等相关专业本科及以上……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。