岗位描述(节选)
1.建设多语种语音大模型(端到端同传、ASR、TTS等)训练数据体系,覆盖中文、英语、阿拉伯语、俄语、土耳其语、泰语、印尼语、越南语等20余个语种。与算法/产品团队协同,评估数据缺口,针对语种特点和模型需求制定数据建设路线与优先级;
2.统筹标注标准和标注资源,定义语音模型高表现力指标,为提升模型在音色多样性、韵律表现、副语言信息、情感表达、表达张力、流式自然度等方面表现提供数据方案;解决多语种在语音同传、翻译场景下的表达习惯、文化适配等问题;
3.建立数据生产规范,搭建智能化数据生产管线,覆盖清洗、预处理、加工、精标、验收等环节,提升中/低资源数据获取效率和质量;主导数据合成、Agent驱动数据生成等智能化数据生产技术的探索和应用,持续生产高质量训练数据,并把控数据合成与采集的合规风险。统筹数据供应商,负责供应商选型、交付标准制定与质量审计;
4.建立主客观结合的数据评价体系,统筹……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。