岗位描述(节选)
1. 研发支撑自动标注、并对标冲击业界 SOTA 的语音算子(识别与对齐、说话人与声学、中文方言/口音/LID、多音字 G2P、中英混、TN/ITN 等),负责训练、评估、迭代与持续对标;
2. 建设亿小时级语音数据资产中枢:内容族与资产族两族标签的 schema/ontology、取数引擎、元数据库、多维查询与按标签取数;
3. 设计跨源去重治理与 train-eval 去污 pipeline,建立数据覆盖率矩阵与缺口诊断,驱动数据按需补齐、形成质量闭环。
【任职要求】
1. 计算机、电子、声学、语言学、统计等相关专业,硕士及以上;
2. 在语音/音频算法或大规模数据工程方向具备扎实功底,能独立承担语音算子研发或数据资产中枢建设;
3. 熟悉 PyTorch、大规模数据 pipeline、向量检索/metadata、数据建模/taxonomy 等相关技术栈之一或多项,能复现并改进业界……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。