进入工作台 →

视觉生成基座算法专家

🏢 美团📍 北京市
🎯 社招 来源:美团招聘
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

负责视觉生成基座模型及应用的整体研发工作,面向图像生成、视频生成及音视频生成等全模态生成场景,构建行业先进的通用视觉生成能力。主要工作包括但不限于: 1. 视觉全模态生成基座模型:设计和优化适用于图像、视频、音视频等多模态场景的统一生成基座模型架构;开展多模态、多任务联合训练与对齐(如图文、视听、动作等),提升模型的通用性与泛化能力;针对不同应用场景(如图像视频内容生成与编辑等)进行模型能力扩展与定制化优化。 2. 高效图像/视频Autoencoder与Tokenizer:研发高效压缩比、低失真度的图像/视频Autoencoder、Tokenizer 等表征模型,支持大规模训练与高吞吐推理;探索适用于长视频、多视角视频等场景的结构化表征方式(如时空Token、分层编码等),平衡压缩率与生成质量。 3. 高效生成与下一代生成架构探索:研究和实现高效的生成范式,包括但不限于扩散模型、自回…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 职通车AI · 岗位数据受版权与反爬保护,禁止抓取与镜像