岗位描述(节选)
1、全双工语音模型研发:参与或主导面向全双工交互的 Audio-LLM / Speech-to-Speech 模型设计与训练,研究流式音频输入输出、跨模态表征及语音理解与生成的一体化建模。
2、交互感知与状态决策:面向全双工语音交互,研究多维信息融合与交互状态建模,提升复杂交互场景下的轮次判断、打断处理及交互决策能力。
3、语音前端算法研发:研发面向实时语音交互的语音前端算法,包括 AEC、语音增强、VAD、说话人感知与目标语音提取等,提升复杂声学环境下的语音质量与交互鲁棒性。
4、数据、训练与评测体系建设:建设面向真实复杂交互场景的数据与评测体系,开展数据构建、模型训练与难例优化,结合业务反馈持续提升模型效果与端到端交互体验。
【任职要求】
1、计算机、人工智能、电子信息、声学、信号处理等相关专业,硕士及以上学历,具备扎实的深度学习基础,以及语音、音频或多模态算法研发经验。
2、在以下……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。