岗位描述(节选)
1、负责多模态评测框架的整体设计,围绕跨模态一致性、时空连续性、物理常识等核心内核拆解可量化子指标,并建立子指标至能力维度的聚合口径。
2、负责 Omni 理解方向评测集的建设与迭代,覆盖图文、视频、音频、文档等混合输入场景下的跨模态对齐、长视频理解、音视频联合理解及多模态指令遵循等能力。
3、负责世界模型生成方向评测方案的设计与落地,覆盖文生视频、图生视频、长时序一致性、物理规律遵循、镜头与运镜控制、可交互世界模拟等评测维度。
4、搭建自动化指标与人工 GSB/Arena 对战相结合的评测链路,制定打分协议与质检机制,控制主观评测的偏差与平局问题。
持续跟踪 GPT、Gemini、Qwen-Omni、Sora、Veo、可灵、Genie 等主流模型的能力演进,输出能力榜与性价比榜。
5、负责 badcase 的结构化归因分析,定位模型在感知、对齐、推理、幻觉及物理真实性、可控性等方面的短板……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。