岗位描述(节选)
1. 面向端到端原生多模态大模型(如流式语音通话),制定关于音频特征、情绪语气、环境背景音、实时插话(Interruption)和语气词(如喘气、叹气、笑声)的复合标注标准。
2. 参与生产高质量的音视频文本三维交织样本。不仅标注“说了什么”,更要精准标注“什么时间点说、用什么情绪说、背景有什么声音”。
3. 负责对供应商交付的音频分段、音乐流派标签、节奏打点、人声分离数据的合格率进行硬核把控,通过盲听与多轮复审杜绝错标。
4. 参与产品团队在执行层不断试验、重组标注工具的UI界面与交互逻辑,降低标注员的听觉疲劳,提升人效。
【任职要求】
1. 硕士及以上学历,声学、音乐、语言学、播音主持、电子信息或AI相关背景优先。
2. 具备敏锐的听觉和音乐/语音感知能力,能准确分辨音频中的微弱环境音、情绪波动的细微变化(如开玩笑与讽刺语气的分辨)。
3. 有过语音库、TTS、ASR或多模态音频项目……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。