岗位描述(节选)
视频生成基座,参与自动驾驶多模态视频生成基座模型的研发,覆盖数据 pipeline、tokenizer / VAE、DiT 架构设计、大规模预训练与后训练,并推动 scaling 上的真实收益。
可交互世界模型,研究 action-conditioned / 可控生成,攻克长时序一致性、可干预性与因果可控性;探索几何与语义约束(3D Occupancy、3DGS、Scene Graph)与生成模型的融合方式。
推理加速与规模化可用性,推动生成模型的推理效率优化,包括一致性 / 蒸馏、few-step 采样、量化与算子层优化,把世界模型的采样成本压到数据合成与仿真规模化可用的量级。
【任职要求】
计算机视觉、机器学习、计算机科学等相关专业硕士及以上学历,博士优先;毕业 3 年以内(在校期间的长期实习经历可计入相关经验)。
以下两类经验至少具备其一,且是深度参与而非调用或下游微调:
视频 /……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。