岗位描述(节选)
本岗位致力于构建大模型的“感官”核心,定义小红书下一代多模态智能基座。小红书拥有业界最独特的图文与短视频 UGC 数据生态,是多模态模型落地最肥沃的土壤。你将负责 VLM 的 Post-training(SFT/RL) 与 架构演进,让模型不仅能“看见”,更能“洞察”与“推理”,深度赋能搜索、广告、推荐、电商、智能创作等全链路业务场景。
你的工作内容:
1. 多模态推理与强化学习 (VLM Reasoning & RL): 探索视觉场景下的 Long-thought 推理范式,利用强化学习等技术提升模型在复杂视觉空间、数学、逻辑及长视频序列下的深度推理能力,实现“边看边思考”。
2. 极致指令遵循与对齐: 负责 VLM 的 SFT 与 RL 流程,针对小红书复杂图文/视频语义,优化多模态对齐质量,解决模型幻觉问题,提升指令遵循的鲁棒性。
3. 超长视频与复杂序列理解: 针对海量视频场景,研……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。