进入工作台 →

国家智能语音创新中心-大模型算法工程师-合肥(J14403)

🏢 科大讯飞📍 安徽省·合肥市💰 面议👥 招 1 人
🎓 硕士及以上 🧭 3年以上 🎯 社招 发布于 2026-09-11 来源:中国移动子公司(北森)
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

1.负责文本、图像、视频和音频的多模态表征学习、特征融合及联合建模。 2.研究跨模态语义对齐算法,解决视觉、语音、文本及终端状态信息之间的表示差异。 3.研究基于交叉注意力、对比学习和共享表征空间的多模态特征融合方法。 4.负责视觉语言模型、音视频语言模型及全模态模型的算法设计、训练和效果优化。 5.研究图像及视频中的视觉指代、目标定位、区域语义理解和细粒度视觉问答算法。 6.研究视频时序建模算法,识别操作前后页面状态变化、界面跳转和动态响应过程。 7.研究音视频联合建模算法,提升模型对提示音、语音反馈、界面变化和设备状态的综合理解能力。 8.建设多模态结果断言模型,将测试意图、操作过程、状态变化和最终结果纳入统一模型进行判断。 9.研究多模态因果推理和状态转移建模,判断终端状态变化是否由指定操作触发。 10.研究复杂场景下的多模态异常识别算法,区分无响应、错误响应、状态…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 求职者营地 · 岗位数据受版权与反爬保护,禁止抓取与镜像