岗位描述(节选)
1. 负责多模态大模型、视觉语言模型、视觉语言导航和具身智能相关算法在机器人系统中的技术规划、方案设计与工程化落地,支撑四足机器人、轮足机器人、巡检机器人等产品的智能交互、环境理解和自主任务执行能力。
2. 负责机器人多模态智能系统的整体架构设计,构建“语言指令理解—视觉场景理解—任务规划—技能调用—执行反馈—异常恢复”的高层决策链路。
3. 负责 VLM / VLN / Agent / Grounding / VLA 等方向的技术选型、模型评估和落地方案设计,判断开源模型、闭源 API、本地部署模型在机器人业务中的适用性、成本和风险。
4. 负责视觉语言导航、目标导航、图像目标点导航、语言指令导航等核心能力建设,将用户语音、文本指令、图像点选 / 框选、目标描述等交互输入转化为机器人可执行的导航目标或任务策略。
5. 负责多模态模型与机器人导航、建图定位、视觉感知、智能跟随、巡检任务、任……
完整岗位描述与官方投递入口,请登录后在岗位详情页查看。