岗位描述(节选)
1.负责文本、图像、视频和音频的多模态表征学习、特征融合及联合建模。
2.研究跨模态语义对齐算法,解决视觉、语音、文本及终端状态信息之间的表示差异。
3.研究基于交叉注意力、对比学习和共享表征空间的多模态特征融合方法。
4.负责视觉语言模型、音视频语言模型及全模态模型的算法设计、训练和效果优化。
5.研究图像及视频中的视觉指代、目标定位、区域语义理解和细粒度视觉问答算法。
6.研究视频时序建模算法,识别操作前后页面状态变化、界面跳转和动态响应过程。
7.研究音视频联合建模算法,提升模型对提示音、语音反馈、界面变化和设备状态的综合理解能力。
8.建设多模态结果断言模型,将测试意图、操作过程、状态变化和最终结果纳入统一模型进行判断。
9.研究多模态因果推理和状态转移建模,判断终端状态变化是否由指定操作触发。
10.研究复杂场景下的多模态异常识别算法,区分无响应、错误响应、状态……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。