进入工作台 →

达摩院-多模态大模型算法工程师(视频理解方向)-杭州

🏢 阿里巴巴控股集团📍 杭州
🎓 硕士 🧭 3年以上 🎯 社招 发布于 2026-09-22 来源:阿里巴巴招聘
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

1. 多模态大模型的视频理解应用:基于主流多模态大模型,通过微调、后训练与模型适配,解决视频内容理解、长视频结构化、视频问答、时序定位及复杂事件推理等问题,推动模型能力落地。 2. 跨模态融合理解:融合音频(语音/音效/说话人)、文本(字幕、ASR 转写、OCR、元数据)等多源信息,设计跨模态对齐与融合方案,提升复杂场景下的理解效果与鲁棒性。 3. 模型效率与部署成本优化:面向长视频推理成本问题,通过蒸馏、剪枝、量化、视觉 token 压缩及推理引擎优化降低资源开销,探索跨帧特征复用、Tracking 辅助推理等效率方案。 4. 数据与评测体系:构建高质量多模态指令与评测数据(视觉-音频-文本对齐),搭建覆盖多任务的数据清洗、标注与评测 pipeline,支撑模型效果迭代。 5. 技术前瞻与创新落地:持续跟踪 Video-LLM 与多模态大模型前沿进展,研判关键技术演进方向,推动前沿技术的…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 求职者营地 · 岗位数据受版权与反爬保护,禁止抓取与镜像