岗位描述(节选)
1. 负责Token Foundry多模态口语交互的算法研发,通过深入理解全链路多模态交互技术,推进大模型增强的语言交互技术能力建设。
2. 多模态交互:
(1)端到端多模态联合建模 - 语音/视觉/文本等模态融合并应用于人机交互场景。
(2)多模态交互应用算法 - 意图动态规划、多智能体协作、多任务推理、主动交互。
(3)多模态对话系统设计 - 多轮交互状态管理、情境感知、情感理解及生成控制。
3. 音视频内容理解:
(1)转写内容后处理 - 书面化、标点、分段分章节。
(2)音视频分析 - 分角色、语种判别、视频场景划分。
(3)口语内容长篇章理解及生成。
4. 探索多模态口语交互技术落地于实际应用场景,包括但不限于:
(1)消费电子-智能穿戴实时交互、手机多模态助手、具身机器人环境感知。
(2)内容消费-音视频媒资、会议场景、电销通话多模态理解等。
5. 持续关注行业前沿动态,通过专……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。