岗位描述(节选)
1、承担视频Caption和参考生成的Instruction职责,特别是在多分镜、高动态、长视频等场景提供精准、全面的描述,最大化弥合文本模态和视频模态之间的差异;
2、承担Agentic PE的职责,对用户指令进行精准、有效、丰富的改写,从15秒片段效果和分钟级成片两个角度实现最佳的PE,控制视频生成模型产出最符合用户需求的视频内容;
3、承担Reward model的职责,能够客观、稳定地评价模型画面、运动、合理性等方面的表现,辅助视频模型训练监控、模型版本选择;
4、承担理解基模后训练的职责,充分利用可灵数据训练最适合团队的多模态理解基座模型,支撑可灵全链路的数据算法、理解算法任务。
【任职要求】
1、有音视频理解、多模态Caption、理解生成一体化、理解/生成Benchmark等方向的经验,有大厂实习、顶会论文优先;
2、有自主开发能力且能用好Agent进行日常工作辅助开发,有……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 11029 个北京岗位(全城各职能合计),其中 2386 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 5.5K ~ 16K(25~75 分位),中位约 9K,最低 2K、最高 300K。
在招岗位较多的企业:美团 1313 个快手 1014 个阿里巴巴集团(含高德/阿里云) 797 个理想汽车 498 个京东 336 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。