岗位描述(节选)
1、评测体系建设
深入理解公司 AI 产品业务场景,结合多模态大模型技术发展趋势,设计并持续完善模型评测体系,包括评测维度、指标定义、评测流程与方法论,确保评测结果能够客观反映模型能力变化与关键问题。
2、数据与评测标准建设
负责多模态大模型训练与评测数据的质量体系建设,包括数据标注规范制定、评测标准设计及数据集构建与优化,沉淀高质量数据资产,为模型训练与评测提供可靠基础。
3、模型评测与效果分析
联合产品与算法团队开展离线评测、场景评测及对比评测,系统分析模型表现与能力边界,输出结构化评测报告,支持模型迭代与产品优化。
4、评测场景与Benchmark构建
围绕核心业务场景构建评测任务与Benchmark体系,持续扩展评测覆盖范围,确保评测体系能够真实反映用户场景与模型能力。
5、数据驱动的优化闭环与行业对标
与算法、产品和数据团队协作,通过评测定位模型问题并推动数据补充与模型优化,建立……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。