岗位描述(节选)
负责视觉生成基座模型及应用的整体研发工作,面向图像生成、视频生成及音视频生成等全模态生成场景,构建行业先进的通用视觉生成能力。主要工作包括但不限于:
1. 视觉全模态生成基座模型:设计和优化适用于图像、视频、音视频等多模态场景的统一生成基座模型架构;开展多模态、多任务联合训练与对齐(如图文、视听、动作等),提升模型的通用性与泛化能力;针对不同应用场景(如图像视频内容生成与编辑等)进行模型能力扩展与定制化优化。
2. 高效图像/视频Autoencoder与Tokenizer:研发高效压缩比、低失真度的图像/视频Autoencoder、Tokenizer 等表征模型,支持大规模训练与高吞吐推理;探索适用于长视频、多视角视频等场景的结构化表征方式(如时空Token、分层编码等),平衡压缩率与生成质量。
3. 高效生成与下一代生成架构探索:研究和实现高效的生成范式,包括但不限于扩散模型、自回……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。