进入工作台 →

【Dots】多模理解-视觉语言大模型研究员

🏢 小红书📍 北京市,上海市
🎯 社招 发布于 2026-08-27 来源:小红书招聘
登录查看完整 JD、匹配评分与一岗一历

岗位描述(节选)

团队介绍 做多模态的人通常有两种:一种是把各种模态「拼」在一起,一种是真的想搞清楚不同模态之间的关系,我们是后者。从视觉理解,到视觉+语音联合感知,到生成与理解统一——我们在挑战的不是某一个模态的单点能力,是整个「理解-生成-统一」的链条,挑战每种模态的单一能力上限,挑战多种模态的融合难题,挑战理解和生成能力的融合难题,实现类人的多模态能力。 岗位职责:参与视觉语言大模型的研发工作,负责下属事项至少一项或若干 VIT Pretrain:提升模型感知能力,包括但不限于 Vision Encoder Pretrain 算法架构 / 多种感知能力数据构建 VLM Pretrain:提升 vlm pretrain 的通用能力,探索各种不同训练阶段设计 / 不同通用数据的组织形式; VLM Post Train:提升 vlm 通用能力,包括但不限于合成数据 / RL 等方法 生成理解统一:探索生成…… 完整岗位描述与官方投递入口,请登录后在岗位详情页查看。
© 2026 求职者营地 · 岗位数据受版权与反爬保护,禁止抓取与镜像