岗位描述(节选)
1. 主导多模态理解大模型评测体系设计,从真实用户场景出发定义核心能力维度,将体验痛点转化为可量化的评测指标。
2. 设计覆盖信息检索、内容理解、文档分析、视频摘要、富媒体问答等高频场景的评测任务,推动评测从"学术任务"向"产品体验"演进。
3. 持续挖掘真实使用中的 Bad Case,做系统性分类与归因,形成问题清单与改进优先级。
4. 建立评测数据质量管控与版本管理机制,定期更新评测集以覆盖新场景与新模态组合。
5. 与产品、算法团队紧密协作,在新模型上线前完成评测,提供数据驱动的优先级建议。
【任职要求】
1. 对多模态 AI 产品有强烈用户视角,能清晰阐述"什么是好的产品多模态理解体验"并转化为可量化指标。
2. 具备从零设计产品侧评测体系的经验,理解评测集在区分度、代表性、生态效度方面的权衡。
3. 2 年以上 AI 产品(多模态大模型、智能助手、AI 搜索、文档/视频理解等)……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。