进入工作台 →

通用音频理解大模型研究员

🏢 米哈游📍 上海
🎯 社招 来源:米哈游招聘
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

专注于AudioLLM通用音频理解模型的研究与开发,参与构建下一代音频基础模型和Omni多模态框架,探索语音、音乐、环境声音等多模态音频内容的统一理解建模方法,推动 audio AI 在理解、生成和交互场景中的技术突破。 核心职责 1、模型架构与训练:负责通用音频理解模型设计与分布式训练优化,实现语音识别、说话人日志、情感分析、音频问答、音乐理解、声音事件检测等多任务统一建模; 2、数据管线:设计并落地大规模多模态音频数据 pipeline,完成数据对齐、质量控制与自动标注; 3、跨模态融合:研究音频编码器与大语言模型融合技术,优化跨模态注意力与统一特征表示。 【任职要求】 1、计算机科学、人工智能、电子工程等相关博士学历; 2、具备大模型(LLM 或多模态)训练经验,熟悉 Transformer 架构与大规模分布式训练框架(Megatron-LM, DeepSpeed,TorchTi…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 求职者营地 · 岗位数据受版权与反爬保护,禁止抓取与镜像