岗位描述(节选)
1. 评测体系设计与搭建: 负责设计和搭建业界领先的全模态(图文、音视频)大模型评测体系,建立科学、全面、高效的评测流程、标准和自动化平台。
2. 评测基准 (Benchmark) 建设: 主导全模态评测基准的建设,持续追踪和引入学界、业界最新成果,并结合业务场景,设计和构建能反映模型真实能力的评测数据集。
3. 核心能力度量: 深入研究全模态大模型的能力边界,设计创新性的评测方法和指标(Metrics),精准度量模型在跨模态理解、内容生成、多轮交互、逻辑推理、鲁棒性及安全性等维度的综合能力。
4. 技术落地与效率提升: 发挥强大的工程和动手能力,主导评测工具链和平台的开发与优化,实现评测流程的自动化和规模化,大幅提升评测效率和质量。
5. 跨团队协作: 与算法、工程、产品团队紧密合作,将评测结果有效转化为模型能力提升和用户体验优化的具体行动,共同打造顶尖的全模态AI产品。
【任职要求】……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。