岗位描述(节选)
【岗位职责】
1. 研究和打造新一代多模态视觉语言模型(VLM),重点突破视频理解与跨模态对齐能力,让模型真正“看得懂、听得清、说得明白”。
2. 设计适用于长时序、复杂动态场景的视频-文本预训练和后训练方案,支撑机器人、虚拟人、交互智能体等多种应用。
3. 构建高效、稳定的大规模视频预训练管线,实现从海量视频数据采集、清洗、建模到训练落地的全链路打通。
4. 深入优化分布式训练与推理性能,探索 Transformer 架构创新、视频表征学习和多任务联合训练。
【任职要求】
1. 计算机科学、人工智能、电子工程等相关专业硕士及以上学历;
2. 在以下至少一个领域具备扎实经验:视频表征(如 TimeSformer、VideoMAE、InternVideo)、多模态预训练、视频-文本对齐、Transformer 架构优化;
3. 熟悉主流深度学习框架(如 PyTorch / JAX),有大规……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
本站当前在招 1148 个深圳技术研发岗位,其中 92 个公开标注了薪资。按这些标注统计:月薪(税前)主流区间 15K ~ 28K(25~75 分位),中位约 20K,最低 6K、最高 100K。
在招岗位较多的企业:字节跳动 205 个中国平安 47 个迈瑞医疗 45 个大族数控 41 个富士康 41 个
统计口径:求职者营地实时在招岗位的公开薪资标注,未标注者不计入;区间为 25~75 分位,非薪酬承诺。