岗位描述(节选)
1、参与快手Kling多模态视频生成的研发和落地工作,包括但不限于:t2v,i2v等基础模型研发、多模态可控视频生成编辑、世界模型等;
2、探索将多模态大语言模型MLLM如DeepSeek/Qwen相关技术与视频生成相结合,包括但不限于:提升Kling视频生成的多模态理解、推理、多轮交互能力等;
3、探索将语音和视频生成相结合,包括但不限于:语音驱动的视频生成,有声视频等;
4、探索实时可拓展的多模态视频生成技术,提升多模态视频生成的质量和效率等;
5、在顶会顶刊上发表研究成果和开源代码,提升团队在多模态视频生成等领域的学术声望。
【任职要求】
1、熟悉视频生成基础模型如SVD、Sora、Meta MovieGen、HunYun Video等;
2、熟悉多模态大语言模型(DeepSeek/Qwen等)、多模态理解生成、世界模型优先;
3、熟悉语音驱动视频生成、语音生成优先;
4、有多模态……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 11029 个北京岗位(全城各职能合计),其中 2386 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 5.5K ~ 16K(25~75 分位),中位约 9K,最低 2K、最高 300K。
在招岗位较多的企业:美团 1313 个快手 1014 个阿里巴巴集团(含高德/阿里云) 797 个理想汽车 498 个京东 336 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。