岗位描述(节选)
团队介绍
负责高德全栈语音技术,能力覆盖语音生成与语音交互两条主线:自研 TTS 基座大模型、多语种与可控语音生成、语音识别与复杂声学理解、端到端对话模型与全双工交互、RTC 流式语音、端侧模型、模型服务与推理优化,以及配套的数据与自动评测体系。业务承载高德全部核心场景:语音导航、AI 领航员、AI 语音助手、室外步行导航与具身交互、IP 语音定制与虚拟陪伴、国际化、智能外呼、语音内容生成(有声书、播客、交互式播客)。团队通过前沿语音技术的研究与落地,支撑下一代 AI 产品创新。
职责
1. 语音交互系统研发
研发多模态对话大模型,实现"边听、边说、边想、边做"的交互形态:流式声学与时空上下文感知、增量语音输出、推理与生成并发、对话中调用工具完成任务。承担语音对话 pipeline、端到端、以及分层解耦(Thinker + Talker)三类方案的选型与实现,攻克全双工下的轮次让渡与抢占时……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。