岗位描述(节选)
实时全双工语音大模型与多模态数字人系统的核心研发,攻克流式交互中的智能打断、接话时机、长程状态保持及音画同步等关键技术难题。
【任职要求】
1. 实时语音/音视频交互方向
○ 做过语音大模型、实时语音助手、语音通话 Agent。
○ 理解用户打断、抢话、等待、接话时机、长对话状态保持。
○ 有流式 ASR/TTS、Speech LM、Audio LM、多模态大模型经验更好。
○ 能把“实时交互自然不自然”拆成评测指标和 benchmark。
2. 实时多模态生成方向
○ 做过数字人、虚拟人、语音驱动 avatar、talking head、全身动作生成、虚拟环境交互。
○ 理解口型同步、表情动作同步、身份一致性、动作自然度、长时稳定性。
○ 有 3D/动画/图形学/视频生成/多模态生成项目经验更好。