岗位描述(节选)
岗位介绍:
AI 正在重塑搜索的底层逻辑——从意图理解到 AIO 聚合生成,从图文检索到多模态体验。但所有这些变化能不能真正发生、能不能持续迭代,取决于一件事:我们是否有能力把"搜得好不好"变成可量化、可追踪、可驱动决策的评估体系。评测不是搜索的附属环节,而是这一切迭代的地基。这个岗位的核心,是搭建并运营这块地基。
岗位职责:
1、设计 AI 搜索的评测产品体系,覆盖搜索大盘评估、策略迭代评估、RL 训练数据支持三类场景,建设自动化评估能力,让评估本身可规模化。
2、与模型和算法团队深度协作,把"搜索质量"这种模糊的体感问题,拆解为可量化的指标体系与可执行的标注方案。
3、探索多模态场景下的评测方法,针对不同模态的特性设计差异化的评估框架。
4、推动评测结论真正落地——影响策略方向、影响产品决策、影响下一轮模型迭代。
【任职要求】
岗位要求:
1、5 年以内工作经验,有过完整的评测体系……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。